# AI Agent 的隐性账单：多花 1000 倍 token，效果未必更好

> 原标题：花了1000倍的token，效果可能却没有更好：AI Agent的“隐性账单”长什么样

- 来源：机器之心 · 公众号
- 发布时间：2026-05-17T03:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22414
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651033486&idx=3&sn=b78e5f51da1734107dbfbe393a7f6e0a

## 摘要

这篇文章本身因为微信环境验证没抓到正文，所以具体实验细节没法展开。但从标题和已有摘要能看出，研究团队用 OpenHands 跑了 8 个前沿模型在 500 个 swe-bench 编程任务上的表现，发现 Agent 模式下输入输出 token 比能到 154:1，而且人类标注的任务难度和实际 token 消耗之间关联很弱，Kendall tau 只有 ...

## 推荐理由

我会先打个折：这不是新模型发布，而是一篇基于轨迹数据的分析，所以放在 78–84 这个推荐区间是合适的。它的钩子很直接——token 花了一千倍，效果未必更好，这对正在给 coding agent 算账的团队来说，比单纯刷榜的新闻更有实际参考价值。文章给出了 OpenHands 在 500 个 swe-bench-verified 任务上的具体数字，154:1 的输入输出比和 0.32 的 Kendall tau，说明模型在排行榜上的名次和实际干活的表现相关性很弱。这点先别太激动，正文没披露不同模型各自的成本曲线，但至少把 agent 的隐性账单摆...

## 锐评

这条新闻最值得看的是它点出了 AI Agent 的“隐性账单”：让模型在编程任务里自主干活时，输入和输出的 token 消耗比可以拉到 154:1。也就是说，模型为了完成一个任务，可能要先吞下大量上下文，再吐出一点点代码。这跟平时我们看单次问答的成本账完全不一样。

不过要泼盆冷水。原文因为微信环境验证失败，正文没抓到，所以 8 个前沿模型在 500 个 swe-bench 任务上的具体表现、哪个模型最“啰嗦”、成功率跟 token 消耗到底什么关系，这些关键信息全是空白。另外，摘要里提到人类标注的任务难度和实际 token 消耗之间关联很弱，Kendall tau 只有 0.32，说明我们凭直觉判断“这题难所以费 token”根本不靠谱。

还缺的东西很多：Agent 跑这些任务的成功率是多少？不同模型之间的效率差距有多大？有没有办法在不掉性能的前提下砍掉无效 token？这些才是决定这条发现能不能落地的关键。
