# Zai 把 GLM-5.1 推理集群的网络架构换了，吞吐量提了 15%

> 原标题：Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild

- 来源：r/LocalLLaMA
- 发布时间：2026-05-28T13:09:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29492
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tq35a0/zai_replaced_the_network_architecture_running/

## 摘要

Zai 在一个千卡规模的 GLM-5.1 代码推理集群上，把原来的 ROFT 网络拓扑换成了自研的 ZCube。硬件、软件栈和模型都没变，但交换机与光模块成本降了 33%，GPU 推理吞吐量提升了 15%。在把输入理解（prefill）和内容生成（decode）拆开跑的部署模式下，首个 token 的 P99 尾部延迟也砍掉了 40.6%。不过帖子正文...

## 推荐理由

HKR 三项都踩中了：GLM-5.1 推理集群的成本、吞吐和延迟数字都很具体，40.6% 的延迟降幅是个强钩子。不过来源只有 Reddit 单帖，且话题偏 infra 细分，所以定在 78 分。

## 锐评

这条消息来自 Reddit，但原文被网络策略挡了，我们只能看到标题和摘要，看不到具体怎么做的。能确认的是：Zai 在一个千卡规模的 GLM-5.1 代码推理集群上，把原来的 ROFT 网络拓扑换成了自研的 ZCube，硬件、软件栈、模型都没动。结果交换机加光模块的成本降了 33%，GPU 推理吞吐量提升了 15%。在把输入理解（prefill）和内容生成（decode）拆开跑的部署模式下，首个 token 的 P99 尾部延迟砍掉了 40.6%。

这几个数字如果属实，确实挺省钱，尤其尾部延迟降四成对线上服务质量帮助很大。但要注意，帖子正文没披露，我们不知道测试负载是什么、基线怎么设的、千卡集群的具体配置，也不知道 ZCube 到底改了网络拓扑的哪一层。这些信息缺口让 33% 成本降幅和 15% 吞吐提升没法独立验证。另外，这是 Zai 自研方案在自己集群上的结果，换到其他环境能不能复现，正文也没说。先当一条有参考价值的工程优化案例看，别急着当通用结论。
