# Z.ai CEO 唐杰谈 GLM 5.3：别再只盯着参数量了，后训练才是新的扩规模法则

> 原标题：[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law

- 来源：Latent Space
- 发布时间：2026-08-20T05:17:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52466
- 原文：https://www.latent.space/p/ainews-death-of-params-zai-ceo-jie

## 摘要

唐杰在 X 上发了一长串帖子，核心就一句话：光看参数量没意义，得把数据量、算力花在哪、模型在什么条件下跑这三件事一起看。GLM 5.3 的提升全靠强化学习在长周期环境里训出来的，有些任务模拟了工程师好几天的工作量，比如给模型一个真实的集群环境，让它自己诊断瓶颈、做优化、跑实验，最后交出可衡量的加速结果。他们搞了一套全自动的合成管线来生成这种可执行、可验...

## 推荐理由

唐杰亲自下场解释 GLM 5.3 的后训练缩放定律，举了模拟集群诊断和优化的实验案例，不是纯话术。但来源是付费 newsletter 的节选，正文没披露具体的加速比、任务成功率这些关键数字，所以判断先打个折——思路有料，验证还得等更多数据。

## 锐评

唐杰这篇帖子最核心的判断是：参数量这个指标已经不够用了，得把数据量、算力分配和运行条件绑在一起看。GLM 5.3 的能力提升几乎全部来自强化学习，而且是在模拟真实工程师工作流程的长周期环境里训出来的。有些任务会扔给模型一个真实的集群环境，让它自己诊断瓶颈、做优化、跑实验，最后交出可衡量的加速结果——这相当于让模型独立完成一个工程师好几天的工作量。

为了规模化地搞到这种训练环境，他们搭了一套全自动的合成管线：研究 agent 从真实工作中抓取任务模式，生成可执行、可验证的长周期环境；裁判 agent 会先跑一遍确认任务可解；验证器也是合成出来的，不接触参考答案，靠 oracle、空操作和未解决状态检查来保证奖励信号可靠。这套流程听起来很自洽，但正文没给出任何关于合成环境质量、错误率或与真实工作偏差的量化数据，所以“全自动”到底有多可靠，得打个问号。

唐杰还提了五个缩放旋钮，包括 MoE 稀疏度，并指出找软件漏洞这类高级技能不是靠死记硬背，而是需要模型在推理时维持 20 步以上的因果链。这个观点有意思，但帖子没披露 GLM 5.3 的具体参数量、训练成本，也没说什么时候能公开用上。如果是真的，这套方法确实省钱——不用无脑堆参数也能提能力；但在看到独立评测和可复现结果之前，先别太激动。
