Zai 把 GLM-5.1 推理集群的网络架构换了,吞吐量提了 15%
Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild
Zai 在一个千卡规模的 GLM-5.1 代码推理集群上,把原来的 ROFT 网络拓扑换成了自研的 ZCube。硬件、软件栈和模型都没变,但交换机与光模块成本降了 33%,GPU 推理吞吐量提升了 15%。在把输入理解(prefill)和内容生成(decode)拆开跑的部署模式下,首个 token 的 P99 尾部延迟也砍掉了 40.6%。不过帖子正文...
推荐理由:HKR 三项都踩中了:GLM-5.1 推理集群的成本、吞吐和延迟数字都很具体,40.6% 的延迟降幅是个强钩子。不过来源只有 Reddit 单帖,且话题偏 infra 细分,所以定在 78 分。