# C2C：让多个大模型直接交换“思考缓存”，比打字快 2.5 倍，准确率还高 3-5%

> 原标题：Cache-to-Cache: Direct Semantic Communication Between Large Language Models

- 来源：Hacker News 首页
- 发布时间：2026-09-18T18:55:35.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57400
- 原文：https://arxiv.org/abs/2510.03215

## 摘要

这篇 ICLR'26 的论文提了个很直接的想法：多个大模型协作时，别让它们互相发文字了，直接传“脑内状态”（KV-cache，可以理解成模型思考到一半的中间结果）。作者先做了个验证实验，发现把 KV-cache 里的语义信息搞丰富点，不用加大缓存，回答质量就能变好，说明这条路走得通。于是他们搞了个叫 C2C 的框架，用一个小神经网络把 A 模型的 KV...

## 推荐理由

ICLR'26的论文，想法很巧：多个大模型配合干活时，别互相发文字了，直接传“脑内状态”（KV-cache）。作者先做了验证，证明把缓存里的语义搞丰富点，不用加大缓存就能提升回答质量，说明这条路走得通。然后他们搞了个C2C框架，用一个小神经网络把A模型的缓存翻译成B模型能懂的格式。有验证有方案，知识密度够，但偏底层优化，不是那种大家一看就想转的日常痛点，所以分数没给更高。

## 锐评

这篇 ICLR'26 论文的思路很直接：多个大模型协作时，别让它们互相发文字了，直接传“思考到一半的中间结果”（KV-cache）。作者先做了个验证实验，发现把缓存里的语义信息搞丰富点，不用加大缓存，回答质量就能变好，说明这条路走得通。于是他们搞了个 C2C 框架，用一个小神经网络把 A 模型的缓存投影、融合进 B 模型，还加了个可学习的门控来选择哪些层需要接收这些信息。

效果上，C2C 比单个模型准确率平均高 6.4% 到 14.2%，比传统文字通信方式高约 3.1% 到 5.4%，延迟平均快了 2.5 倍。代码也开源了。

不过有几个地方得打个折。第一，实验用的是哪些模型组合、在什么任务上测的，摘要里没细说，换一组模型或者换到更复杂的推理任务上，这个 2.5 倍加速和准确率提升能不能稳住，不好说。第二，那个做投影和融合的小网络本身也要训练，训练成本、对训练数据的依赖，正文没披露。第三，直接传缓存意味着两个模型得有兼容的架构，这在实际异构模型协作场景里是个硬限制。整体看，想法有意思，但离“随便拿两个模型就能用”还有距离。
