我能买你的 KV 缓存吗?
Can I Buy Your KV Cache?
现在每个 AI 智能体读同一份文档,都要从头算一遍最耗算力的“预填充”步骤,生成一份完全一样的 KV 缓存。这篇论文提了个很直接的方案:让内容发布方提前把文档的 KV 缓存算好,其他智能体直接花钱加载,跳过预填充。在 Qwen3-4B 上实测,复用缓存比重新预填充便宜 9 到 50 倍,而且输出的 token 完全一致,精度零损失。但直接把缓存文件传出...
推荐理由:这篇论文提了个很直接的办法:让内容发布方提前把文档的 KV 缓存算好,其他智能体花钱加载,跳过最耗算力的预填充步骤。在 Qwen3-4B 上实测,复用缓存比重新预填充便宜 9 到 50 倍,而且输出 token 完全一致,精度零损失。我会先打个折——目前只在 Qwen3-4B 一个模型上验证过,正文没披露缓存安全、定价机制这些落地细节,这点先别太激动。但思路本身很实用,把缓存从技术细节变成了可交易资源,对做 agent 流水线的人吸引力很大。