# 智谱在千卡集群部署 ZCube，同样 GPU 推理吞吐提升超 15%

> 原标题：推翻二十年组网逻辑，智谱落地ZCube，让同样的GPU多干15%的活

- 来源：机器之心 · 公众号
- 发布时间：2026-05-21T03:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25472
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651034260&idx=1&sn=79d1469b24b4a814ece601bcc00a5f95

## 摘要

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里，规模是千卡级别。它替换了原来的 ROFT 组网方式，但没动 GPU、软件栈和业务代码。效果上，吞吐量提升了超过 15%，首 token 延迟的 P99 下降了 40.6%，交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的，也没给更细的测试条件，所以这个 1...

## 推荐理由

智谱在 GLM-5.1 千卡推理集群上部署 ZCube，不增 GPU、不改代码就把吞吐提了 15%，首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动，不是模型能力升级，所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用，但不会像新模型发布那样震动整个行业。

## 锐评

智谱在GLM-5.1的线上推理集群里换掉了原来的ROFT组网，用上了自研的ZCube通信方案。最直接的好处是同样的GPU多干了超过15%的活，同时用户感知最强的首token延迟，最差的那1%请求也快了40.6%。硬件成本上，交换机加光模块的开销省了三分之一，这对千卡规模集群来说不是小钱。

不过正文没披露具体怎么做到省硬件成本的，也没给测试条件，比如跑的是什么模型、什么精度、batch size多大。这些信息缺了，15%的吞吐提升能不能在别的场景复现就要打个问号。另外，文章提到没动GPU、软件栈和业务代码，说明这个方案对现有基础设施的侵入性很低，落地阻力应该不大，但具体实现细节还是没讲。

还缺的是跟其他通信方案的横向对比，以及这个方案在更大规模集群上的表现。千卡级别已经不小，但如果要撑起下一代模型训练，万卡甚至更大规模下的稳定性才是硬指标。
