# KV cache 命中率：Agent 推理的第一成本杠杆

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-06-25T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40631
- 原文：https://yage.ai/share/prefix-cache-agent-cost-lever-20260625.html

## 摘要

一个跑10次工具调用的ReAct agent，只产出500个token，却要反复重读80万个input token。Spheron测出prefill占agent推理成本的85%到95%，输入输出token比高达267:1。账单大头不是生成新内容，而是让模型每轮都把旧信息重新咀嚼一遍。把KV cache命中率从0%拉到90%，月GPU账单能从2万美元降到...

## 推荐理由

Spheron的生产实测数据加上arXiv的独立验证，还有Cockroach Labs和Manus的佐证，把agent推理成本结构讲得很透。267:1的输入输出比和90%缓存命中率下账单砍到十分之一，都是实打实的数字。分数没给更高，是因为正文没披露测试用的具体模型规格和并发量，实际省钱幅度得打个折看。

## 锐评

这条信息值得所有跑多轮 agent 的团队点开看。Spheron 测出 prefill 占 agent 推理成本的 85% 到 95%，输入输出 token 比高达 267:1，模型每生成一个字就要重读 267 个字。这个数字解释了为什么 prompt caching 的折扣能打到一折——供应商在缓存复用时几乎没有额外 GPU 开销。

文章把提升命中率的工程栈拆成三层：压缩层让 KV 矩阵变小，CompressKV 只保留 3% 的缓存就能守住 97% 的 LongBench 性能，但 FlashAttention 内核不暴露 attention score，算法好不等于能落地；路由层解决多副本下请求被随机分发导致缓存全部 miss 的问题，llm-d 的方案把 TTFT p90 从 92.5 秒压到 0.54 秒；API 层是大多数开发者唯一能直接碰的，但 Anthropic 今年 3 月静默把缓存 TTL 从 1 小时砍到 5 分钟，用户账单瞬间暴涨 100 倍。

文章没给出不同压缩方案在真实生产环境下的横向对比数据，也没说明路由方案在并发波动时的缓存颠簸阈值。如果你用的是 API 而不是自建集群，三层里只有 API 层能动手，另外两层看看就好。
