# GLM-5.3：只靠后期训练，把开源模型的编程和漏洞利用能力拉到一线

> 原标题：GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

- 来源：Hacker News 首页
- 发布时间：2026-08-14T05:19:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50640
- 原文：https://z.ai/blog/glm-5.3

## 摘要

GLM-5.3 和上一代用的是同一个基座模型，所有提升全来自后期训练。编程能力在内部 Z.ai Code Bench 上比 5.2 高了 50%，Terminal Bench 3.0 从 4.6 分跳到 28.3 分。更意外的是漏洞利用能力涨得比预期快：ExploitGym 2 小时得分从 29 涨到 105，6 小时从 39 涨到 130。团队把原因...

## 推荐理由

GLM-5.3 和上一代用同一个基座，所有提升全靠后期训练。编程分涨了50%，终端操作从基本不会（4.6分）变成能干活（28.3分）。更扎眼的是漏洞利用：2小时得分从29跳到105，6小时从39跳到130。团队自己说这块能力涨得比预期快，我会先打个折——内部评测的绝对值不能直接跟外部基准比，但涨幅摆在那里。正文没披露后期训练具体用了什么方法和数据，这点信息缺口挺大。

## 锐评

这条发布最值得看的是“同一个基座模型，只靠后期训练”这个前提。团队没换底模，把算力全砸在更贴近真实工作流的训练环境上，让模型去处理需要跨多步、有隐藏状态的复杂任务。结果编程分涨了 50%，Terminal Bench 3.0 从 4.6 跳到 28.3，说明模型在长链路任务上确实变稳了。

更意外的是漏洞利用能力：ExploitGym 2 小时得分从 29 涨到 105，6 小时从 39 涨到 130。团队自己都说涨得比预期快。这跟训练环境设计有关——他们让模型像真人专家一样跑完整的漏洞利用链，而不是只做单步操作。

不过得打几个折。所有内部基准（Z.ai Code Bench、ExploitGym）都没法独立复现，公开榜上 Terminal Bench 3.0 的 28.3 分离 Fable 5 的 33.7 和 GPT-5.6 的 34.6 还有差距。权重要等两周安全加固后才开源，现在只能看博客。正文没披露训练用了多少算力、成本多少，也没说漏洞利用能力的安全边界怎么划。
