跳到正文
Computing Life · Share · 鸭哥调研

智谱 GLM-5.1 API 跑到每秒 400 个 token,靠的不是优化,是换了一套执行逻辑

GLM-5.1 达到 400 tokens/s 背后的技术:当推理速度成为新的 Scaling Law

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API,输出速度标称 400 tokens/s,是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的,而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离,让数据持续流动,GPU 不再频繁启停。模型本身也做了...

推荐理由:400 tokens/s 是个好钩子,但正文没交代测试条件、并发数、输入长度和计费规则,所以速度先打个折看。TileRT 的说法有信息量,不过没展开具体怎么重构执行模型,技术细节偏薄。整体对从业者有提醒价值,但缺少独立验证,所以分数停在 78 不动。

读原文 ↗导出 Markdown