# 智能体工作负载正在改写推理成本账本

> 原标题：智能体工作负载悄然重塑推理经济

- 来源：AI HOT 精选
- 发布时间：2026-05-22T17:01:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25660
- 原文：https://x.com/SemiAnalysis_/status/2057869518295249373

## 摘要

SemiAnalysis 扒了 43.2 万条真实编码智能体的请求记录，输入 token 的中位数不是大家常说的 3.2 万或 6.4 万，而是 9.6 万。这个量级意味着模型在接到你的问题之前，已经吞下了比《了不起的盖茨比》全书还长的上下文。正文没披露用了哪些模型、成本曲线、采样方式和统计时间窗口，所以这个数字先当个参考，别急着拿它算账。

## 推荐理由

HKR 三项都过：SemiAnalysis 拿出了一个 43.2 万条编码智能体请求的数据集，中位输入 9.6 万 token，这个数据点本身够硬。但模型、成本曲线、采样方法全都没说，所以只能算强数据点，到不了必写级别。

## 锐评

这条数据点值得从业者看一眼，因为它直接打脸了行业里对智能体输入长度的普遍假设。9.6 万 token 的中位数意味着模型在接到你的问题之前，已经吞下了比《了不起的盖茨比》全书还长的上下文——这对推理成本和延迟的影响是实打实的。如果这个数字有代表性，那很多按 3.2 万 token 做的成本估算都得重算。

不过我会先打个折。正文没披露这 43.2 万条请求来自哪些模型、采样时间窗口多长、有没有过滤掉异常值。如果样本里混了大量调试阶段的超长上下文请求，中位数就会被拉高。另外也没说成本曲线——输入长了，但模型是不是用了缓存、分块处理或者投机解码来压成本，这些都不知道。

还缺两样东西：一是输出 token 的分布，光看输入不看产出，算不出完整的推理账单；二是不同模型在这个输入量级下的延迟和成功率对比。有这两块，才能判断 9.6 万 token 到底是新常态，还是某个特定场景的偏态。
