# GLM 用十万张国产卡搭了自己的推理基建，两周内吞吐量翻了三倍

> 原标题：GLM Built Its Own Inference Infrastructure

- 来源：Hacker News 首页
- 发布时间：2026-09-17T08:27:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57103
- 原文：https://z.ai/blog/glm-built-its-inference-infrastructure

## 摘要

智谱把 GLM-5.3-Flash 的推理服务全跑在了十万多张国产 AI 加速卡上。芯片内存小、带宽低、软件生态也不成熟，团队没全靠人堆，而是让 GLM-5.3 自己当“基建 Agent”去定位瓶颈。他们把端到端的稀疏指标拆成内核正确性检查、微基准测试和执行轨迹这些可追溯的细粒度反馈，Agent 就能直接揪出问题在哪。配合张量并行、W8A8 量化、混合...

## 推荐理由

智谱让 GLM-5.3 自己当 Agent 去调试自家推理基建，跑在十万多张国产卡上，这个切入点本身就很有话题性。技术细节也给得实在，比如把稀疏指标拆成可追溯的细粒度反馈，配合 W8A8 量化，不是那种只讲故事的公关稿。不过正文在关键的性能和稳定性指标上截断了，这点先别太激动，等完整数据出来再判断实际效果。

## 锐评

智谱这篇博客讲的是他们怎么在十万多张国产 AI 加速卡上把 GLM-5.3-Flash 的推理服务跑起来。国产卡内存小、带宽低、软件生态不成熟，团队没全靠人堆，而是让 GLM-5.3 自己当“基建 Agent”去定位瓶颈。做法是把端到端的稀疏指标拆成内核正确性检查、微基准测试和执行轨迹这些可追溯的细粒度反馈，Agent 就能直接揪出问题在哪。配合张量并行、W8A8 量化、混合精度 KV 缓存和一种叫 EPD 的解耦架构，端到端吞吐比初始基线提高了大约三倍，单 token 成本追平了主流英伟达 GPU。上线一周处理了超过 62 万亿 token，在 OpenCode 和 OpenRouter 上都成了用量最大的模型。

这篇东西更像技术叙事而非技术报告。它说了“成本达到可比水平”，但没给出任何具体数字，也没说明对比的是哪款英伟达卡、在什么负载下。三倍提升的起点是“初始基线”，这个基线有多低、是不是故意留了优化空间，正文也没交代。Agent 具体怎么介入优化循环、人工干预占比多少，同样模糊。

最值得看的是他们把反馈粒度做细的思路——不是给 Agent 扔一句“延迟高了 30%”，而是让它能看到内核级正确性检查和执行轨迹。这对想用模型辅助系统调优的团队有参考价值。但整体上，这篇文章是在讲“我们正在走向模型自我改进”的故事，实际工程细节和可复现性还差得远。
