# 智谱发布 GLM-5.1 高速版，API 输出冲到每秒 400 个 token

> 原标题：智谱GLM-5.1高速版发布：刷新全球大模型API速度纪录

- 来源：AI HOT 精选
- 发布时间：2026-05-22T02:02:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25427
- 原文：https://www.ithome.com/0/953/717.htm

## 摘要

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口，输出速度标称 400 tokens/s，说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折，这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化：推理引擎重写了核心路径来提升单卡吞吐；调...

## 推荐理由

智谱扔出一个 400 tokens/s 的 API 速度数字，说是全球纪录，我会先打个折——正文没披露测试条件、并发数、上下文长度和定价，这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量，说明国产模型在推理加速上开始卷工程落地，不只是卷榜单。对从业者来说，速度快意味着同样任务花钱少、等得短，这点先别太激动，等看到实际压测和价格再判断值不值得切。

## 锐评

智谱这次放出的 GLM-5.1 高速版，核心卖点是把旗舰模型的能力和 400 tokens/s 的输出速度同时塞进了生产环境。过去高速模型通常是小模型，能力会打折，这次智谱声称打破了惯例。提速主要靠 TileRT 团队在推理引擎上做的系统级优化，思路是把计算图在编译期就静态编排好，让 GPU 常驻一个内核干活，省掉了反复启动、读写和同步的开销。

不过，正文只给了速度数字，没披露这个高速版在代码、推理等任务上的具体跑分，也没提价格。400 tokens/s 是稳定吞吐还是瞬时峰值，智谱说做了优化保证可用，但没给出高并发下的延迟分布数据。另外，目前只开放给部分企业客户，普通开发者还摸不到。

这条消息值得关注的点在于，它把推理优化的战场从模型压缩拉到了系统层。但实际值不值得上，还得等第三方测过能力衰减和成本之后再说。
