# 智能体 token 用量超人类 5 倍，但缓存打折后实际账单只多 1 倍

> 原标题：智能体 token 用量过线人类、OpenAI 自研芯片跑分出炉、GitHub 发布文档压缩原型

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-03T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54745
- 原文：https://yage.ai/share/caching-discount-three-ledgers-20260903.html

## 摘要

OpenRouter 数据显示智能体每周消耗 7.3 万亿 token，名义上是人类用量的 5.2 倍。但这 5.2 倍里 70% 到 85% 是缓存读取，模型服务商对这部分只收原价的一折左右，所以实际账单大概只多出 1 倍。这个数字只能代表 OpenRouter 一家平台，它的流量只占全球推理量的 1%，而且区分人类和智能体的算法权重没公开，没法复现...

## 推荐理由

三条消息打包，但核心价值在第一篇：终于有人把智能体名义 token 消耗和缓存打折后的真实成本拆开算了，结论是实际账单大概只翻了一倍。OpenAI 芯片跑分和 GitHub 文档压缩原型是附赠信息，密度稍低。跨源聚合的编辑判断清晰，没有硬吹。

## 锐评

这三条新闻凑在一起，讲的是同一件事：缓存折扣让名义数字和实际成本严重脱节。OpenRouter 的数据显示智能体每周烧掉 7.3 万亿 token，名义上是人类的 5.2 倍，但其中 70% 到 85% 是缓存读取，服务商对这部分只收原价一折左右，粗算下来实际账单大概只多出一倍。这个数字只能代表 OpenRouter 一家平台，它的流量只占全球推理量的 1%，区分人类和智能体的算法权重也没公开，没法复现。更麻烦的是智能体经常掉进重试风暴，一遍遍重来，token 滚上去了，干的活没变多。

GitHub 的文档压缩工具和 OpenAI 的芯片跑分也栽在同一个坑里。压缩工具官方说复用 2,000 次回本，但那是按全价算的。把缓存折扣算进去，中位回本门槛直接抬到 5,000 次以上，全缓存场景甚至要 20,000 次。芯片跑分在固定长度测试里赢了 Nvidia，但缺了模拟真实智能体负载的 AgentX 成绩，而真实负载里占比最大的活儿，正好是享受折扣的重复内容读取。这三笔账提醒我们，看 AI 成本数字，先问一句：缓存折扣算进去了没有。
