# GLM-5.2 登顶开源模型排行榜，在智能体任务上打平 GPT-5.5

> 原标题：GLM-5.2 is the new leading open weights model on Artificial Analysis

- 来源：Hacker News 首页
- 发布时间：2026-06-17T09:12:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38911
- 原文：https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index

## 摘要

Z.ai 的 GLM-5.2 在 Artificial Analysis 的 Intelligence Index v4.1 上拿了 51 分，超过 MiniMax-M3 和 DeepSeek V4 Pro（都是 44 分），成了目前最强的开源权重模型。模型体量没变，还是 744B 总参数、40B 活跃参数，但科学推理和智能体任务进步明显：HLE 涨了...

## 推荐理由

GLM-5.2 在 Artificial Analysis 的 Intelligence Index 上拿了 51 分，超过 MiniMax-M3 和 DeepSeek V4 Pro，成了最强开源权重模型。参数没变，分数涨了 11 分，科学推理和智能体任务有实打实的提升。但这是单一评测机构的单榜成绩，没有其他来源交叉验证，所以重要性给到 82 分，先打个折。

## 锐评

Z.ai 这次没动模型体量，还是 744B 总参数、40B 活跃参数，但把科学推理和智能体任务的分拉上来了。HLE 涨了 12 个点到 40%，CritPt 涨了 16 个点到 21%，在模拟真实业务场景的 GDPval-AA v2 上拿了 1524 分，跟 GPT-5.5 的高推理模式打平。这个分挺硬，但代价也明显：每个任务平均吐 43k token，比上一代多了 65%，单任务成本从 $0.25 涨到 $0.46。API 价格没变，还是 $1.4/$4.4/$0.26 每百万 token，上下文窗口从 200K 扩到 1M，MIT 协议开源。

分数好看，但得打个折。GDPval-AA v2 的评测方法换了，把人类基准拉到 1000 分，换了新裁判模型，还把任务轮数从 100 提到 250，所以跟旧版分数不能直接比。正文没披露这个 1524 分在人类基准里算什么水平，也没说裁判模型是谁、有没有偏向性。另外，token 效率掉得厉害，在智能体任务上尤其吃资源，实际跑起来延迟和成本会比纸面数字更难看。

还缺几个关键信息：模型权重什么时候放出来、本地部署的最低硬件要求、以及多语言尤其是中文场景下的实测表现。如果这些不补上，现在这个“最强开源”的结论只能算半个。
