C2C:让多个大模型直接交换“思考缓存”,比打字快 2.5 倍,准确率还高 3-5%
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
这篇 ICLR'26 的论文提了个很直接的想法:多个大模型协作时,别让它们互相发文字了,直接传“脑内状态”(KV-cache,可以理解成模型思考到一半的中间结果)。作者先做了个验证实验,发现把 KV-cache 里的语义信息搞丰富点,不用加大缓存,回答质量就能变好,说明这条路走得通。于是他们搞了个叫 C2C 的框架,用一个小神经网络把 A 模型的 KV...
推荐理由:ICLR'26的论文,想法很巧:多个大模型配合干活时,别互相发文字了,直接传“脑内状态”(KV-cache)。作者先做了验证,证明把缓存里的语义搞丰富点,不用加大缓存就能提升回答质量,说明这条路走得通。然后他们搞了个C2C框架,用一个小神经网络把A模型的缓存翻译成B模型能懂的格式。有验证有方案,知识密度够,但偏底层优化,不是那种大家一看就想转的日常痛点,所以分数没给更高。