# 智谱 GLM-5.1 API 跑到每秒 400 个 token，靠的不是优化，是换了一套执行逻辑

> 原标题：GLM-5.1 达到 400 tokens/s 背后的技术：当推理速度成为新的 Scaling Law

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-05-22T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/26236
- 原文：https://yage.ai/share/glm51-highspeed-api-20260522.html

## 摘要

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API，输出速度标称 400 tokens/s，是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的，而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离，让数据持续流动，GPU 不再频繁启停。模型本身也做了...

## 推荐理由

400 tokens/s 是个好钩子，但正文没交代测试条件、并发数、输入长度和计费规则，所以速度先打个折看。TileRT 的说法有信息量，不过没展开具体怎么重构执行模型，技术细节偏薄。整体对从业者有提醒价值，但缺少独立验证，所以分数停在 78 不动。

## 锐评

这条消息的核心不是“快”，而是“怎么变快的”。传统推理优化像给工厂每个工位提速，但工位之间交接班的时间没省。TileRT的做法是拆掉工位间的墙，让数据像流水一样不间断地流过所有计算步骤，GPU不再频繁启停。配合GLM-5.1模型本身只激活部分参数、一次预测多个token的设计，才跑出了这个速度。在单卡B200上，它的解码速度是vLLM的1.48倍，预热时间也从几分钟压到了35秒，这对需要频繁扩缩容的生产环境挺实用。

不过，正文没披露这个速度是在什么硬件、多大并发、多长上下文下测出来的，也没提延迟分布和价格。量子位的实测也说要更多条件验证。所以400这个数目前只能当个上限看，实际API调用时大概率会打折。另外，TileRT的核心编译引擎还没完全开源，外部很难复现或审计。

这件事更大的意义在于，AI API的竞争轴正在从“谁更聪明”转向“聪明且谁更快”。当几个模型都能完成同一个任务时，从发出指令到看到代码的时间就成了体验分水岭。智谱选“速度×质量”这条路，比继续跟DeepSeek拼价格要聪明，因为成本低到一定程度后，用户更烦的是转圈等待。但速度竞赛的终局不是比谁数字大，而是看谁能把低延迟稳定地交付给企业级工作流。
