KV cache 命中率:Agent 推理的第一成本杠杆
一个跑10次工具调用的ReAct agent,只产出500个token,却要反复重读80万个input token。Spheron测出prefill占agent推理成本的85%到95%,输入输出token比高达267:1。账单大头不是生成新内容,而是让模型每轮都把旧信息重新咀嚼一遍。把KV cache命中率从0%拉到90%,月GPU账单能从2万美元降到...
推荐理由:Spheron的生产实测数据加上arXiv的独立验证,还有Cockroach Labs和Manus的佐证,把agent推理成本结构讲得很透。267:1的输入输出比和90%缓存命中率下账单砍到十分之一,都是实打实的数字。分数没给更高,是因为正文没披露测试用的具体模型规格和并发量,实际省钱幅度得打个折看。