# 我能买你的 KV 缓存吗？

> 原标题：Can I Buy Your KV Cache?

- 来源：Hacker News 首页
- 发布时间：2026-06-12T20:14:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37902
- 原文：https://arxiv.org/abs/2606.13361

## 摘要

现在每个 AI 智能体读同一份文档，都要从头算一遍最耗算力的“预填充”步骤，生成一份完全一样的 KV 缓存。这篇论文提了个很直接的方案：让内容发布方提前把文档的 KV 缓存算好，其他智能体直接花钱加载，跳过预填充。在 Qwen3-4B 上实测，复用缓存比重新预填充便宜 9 到 50 倍，而且输出的 token 完全一致，精度零损失。但直接把缓存文件传出...

## 推荐理由

这篇论文提了个很直接的办法：让内容发布方提前把文档的 KV 缓存算好，其他智能体花钱加载，跳过最耗算力的预填充步骤。在 Qwen3-4B 上实测，复用缓存比重新预填充便宜 9 到 50 倍，而且输出 token 完全一致，精度零损失。我会先打个折——目前只在 Qwen3-4B 一个模型上验证过，正文没披露缓存安全、定价机制这些落地细节，这点先别太激动。但思路本身很实用，把缓存从技术细节变成了可交易资源，对做 agent 流水线的人吸引力很大。

## 锐评

这篇论文的想法简单到有点冒犯：现在每个AI智能体读同一份文档，都要从头算一遍最耗算力的“预填充”，生成一份完全一样的KV缓存。作者说，干脆让发布方提前算好，其他人花钱加载就行。在Qwen3-4B上实测，复用缓存比重新预填充便宜9到50倍，而且输出的token完全一致，精度零损失。这个省钱幅度会随文档变长而拉大，因为预填充的注意力计算复杂度是平方级的。

但有个关键坑：KV缓存几乎压不动，直接把文件传出去，网络传输费比省下的算力还贵。所以作者给出的解法是让缓存留在服务商那边，像现在生产环境里的提示缓存一样用。他们算了一笔账：一份3774个token的热门文档，给8000万个智能体服务，重新预填充要花约150万美元，复用缓存只要约3万美元，差了49.7倍。

论文把这个模式叫做“面向智能体的预填充CDN”，但正文没给出跨服务商结算的具体方案，也没解决KV缓存的无损压缩问题。这两个缺口让“买缓存”这件事暂时还停留在自家服务商内部用，跨平台交易还跑不通。如果压缩和支付层能补上，这个省钱逻辑对高频文档服务确实成立。
