跳到正文
机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

推翻二十年组网逻辑,智谱落地ZCube,让同样的GPU多干15%的活

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

读原文 ↗导出 Markdown