# GLM-5.2 发布：第一个真正能用 100 万 token 上下文的开源模型，专啃长周期编程任务

> 原标题：GLM-5.2: Built for Long-Horizon Tasks

- 来源：Hugging Face 博客
- 发布时间：2026-06-17T09:01:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39820
- 原文：https://huggingface.co/blog/zai-org/glm-52-blog

## 摘要

Z.AI 开源了 GLM-5.2，一个为长周期编程任务设计的模型。它把上下文窗口做到了 100 万 token，而且不是光能塞进去，是在 agent 跑一长串操作后质量依然稳得住。架构上用了两个新东西：IndexShare 让每四层稀疏注意力共用一个索引器，在 100 万 token 长度下把每个 token 的计算量砍到了原来的约三分之一；MTP 投...

## 推荐理由

Z.AI 开源了 GLM-5.2，主打 100 万 token 上下文和长周期 agent 任务。架构上 IndexShare 和 MTP 投机解码都是新东西，不是换皮。不过正文没放完整 benchmark，我会先打个折，卡在 85 以下。

## 锐评

Z.AI 这次开源了一个专门啃长周期编程任务的模型。最实在的改进是上下文窗口做到了 100 万 token，而且不是那种“能塞进去但读不懂后半段”的纸面参数——在 agent 跑一长串操作后，回答质量依然稳得住。架构上用了两个新东西：IndexShare 让每四层稀疏注意力共用一个索引器，在百万 token 长度下把每个 token 的计算量压到了原来的约三分之一；MTP 投机解码的接受长度提升了最多 20%，意味着推理时能更快吐出 token。

跑分方面，FrontierSWE 上比 GPT-5.5 高 1%，PostTrainBench 排在 GPT-5.5 和 Opus 4.7 之后拿了第二，三个长周期编程榜单里都是开源第一。MIT 协议，没设地区限制，这点对国内开发者友好。

不过正文没披露模型参数量和训练数据细节，也没说这 1M 上下文在实际部署时吃多少显存、推理延迟到底多少。1% 的领先幅度在 SWE-bench 这类基准上基本属于误差区间，别当成代差。另外，IndexShare 论文链接给了，但 RL 防作弊训练的具体方法写得比较模糊，实际落地效果还得等社区复现验证。
