# GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Gemini 3.1 Pro，开源模型差距缩到半年

> 原标题：Wow, GLM-5.1 beat Opus 4.6, GPT-5.4, and Gemini 3.1 Pro on SWE-Bench Pro (58.4 vs 57.3 / 57.7 / 54.2) as an open-weight…

- 来源：X · @Yuchenj_UW
- 发布时间：2026-04-07T16:52:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3684
- 原文：https://x.com/Yuchenj_UW/status/2041559747065999664

## 摘要

GLM-5.1 在 SWE-Bench Pro 编程基准上拿了 58.4 分，比 Opus 4.6 的 57.3、GPT-5.4 的 57.7 和 Gemini 3.1 Pro 的 54.2 都高。模型是 MIT 协议开源的，权重公开。发帖人说开源和闭源的差距现在大概只剩六个月。不过正文没交代各家模型是不是在完全一样的条件下跑的，也没提测试成本和复现细...

## 推荐理由

GLM-5.1 以开源权重身份在 SWE-Bench Pro 上超过三个闭源旗舰，分数差虽然不大，但够拿来讨论了。问题在于信息全来自一条推文，没给评测设置、运行成本、是否同条件对比，这些才是判断分数含金量的关键。我会先打个折，把这条当信号看，不当结论用。

## 锐评

GLM-5.1 在 SWE-Bench Pro 上拿了 58.4 分，比 GPT-5.4 的 57.7 和 Opus 4.6 的 57.3 都高一点，而且是 MIT 协议开源的，权重直接给。发帖人说开源和闭源的差距现在大概只剩六个月，这个判断挺乐观，但得看前提成不成立。

正文没披露几个关键信息：各家模型是不是在完全一样的 prompt、环境和预算下跑的，测试有没有第三方独立复现，以及 GLM-5.1 在这个基准上赢的这零点几分到底能不能在真实项目里复现。SWE-Bench Pro 本身测的是修 bug 和改代码的能力，分数差这么小的时候，排名波动可能只是评测噪音。

另外，帖子没提推理成本和延迟。如果 GLM-5.1 是用更大的算力或更慢的速度换来的分数，那“开源追上闭源”这个说法就得打折。想看它到底值不值得切过去，还得等有人拿它跑一遍真实代码仓库，看看成功率、耗时和成本。
