跳到正文
AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱GLM-5.1高速版发布:刷新全球大模型API速度纪录

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

读原文 ↗导出 Markdown