tok/s 是 agentic 场景里最会骗人的性能数字
作者拿 Cerebras 托管的 Qwen 27B(宣称每秒 1500 token)和本地跑的同一模型(实测每秒 102 token)做了一次真实写代码工作流的对比。算上输入预填充的时间后,云端实际有效吞吐只有 357 tok/s,比本地 102 tok/s 快 3.5 倍,远不是纸面上的 15 倍。更麻烦的是,云端模型吐字越快,agentic 循环转...
推荐理由:作者用30天的真实agentic工作流数据,把Cerebras宣称的1500 tok/s拉回到有效吞吐357 tok/s——只比本地快3.5倍。数字和方法论都扎实,不是空对空。没给更高分是因为云端样本偏小(28次生成),且本地配置细节没完全展开,结论的普适性可以先打个折。