# tok/s 是 agentic 场景里最会骗人的性能数字

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-06T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55206
- 原文：https://yage.ai/share/toks-deceptive-agentic-20260906.html

## 摘要

作者拿 Cerebras 托管的 Qwen 27B（宣称每秒 1500 token）和本地跑的同一模型（实测每秒 102 token）做了一次真实写代码工作流的对比。算上输入预填充的时间后，云端实际有效吞吐只有 357 tok/s，比本地 102 tok/s 快 3.5 倍，远不是纸面上的 15 倍。更麻烦的是，云端模型吐字越快，agentic 循环转...

## 推荐理由

作者用30天的真实agentic工作流数据，把Cerebras宣称的1500 tok/s拉回到有效吞吐357 tok/s——只比本地快3.5倍。数字和方法论都扎实，不是空对空。没给更高分是因为云端样本偏小（28次生成），且本地配置细节没完全展开，结论的普适性可以先打个折。

## 锐评

这篇文章用自己工作站上连续30天、7.3万个真实样本的实测数据，把“吐字快就是好”的幻觉戳破了。作者拿Cerebras托管的Qwen 27B（宣称1500 tok/s）和本地同款模型（实测102 tok/s）跑真实写代码流程，发现算上输入预填充后，云端有效吞吐只有357 tok/s，纸面15倍的差距缩水到3.5倍。更致命的是，模型吐字越快，agentic循环转得越猛，上下文在65秒内从11K膨胀到99K，累计送出86.5万token，直接撞上45万的总限额，会话三分钟就被429错误掐死，账单1.57美元。同样的活本地跑要11分钟，电费1.7美分。

文章的价值在于提出了一个更务实的评估公式：可用性等于智能门槛乘以有效吞吐、上下文寿命、成本和可靠性。本地方案在速度上输了，但在后三项上全赢，综合下来反而更实用。不过要留意，作者也坦承这套数据来自个人工作流，不代表行业平均，而且面对需要超长上下文和深层推理的重活，本地小模型依然不够看。整篇判断都挂在实测数字上，没有空谈，对选型很有参考意义。
