GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Gemini 3.1 Pro,开源模型差距缩到半年
Wow, GLM-5.1 beat Opus 4.6, GPT-5.4, and Gemini 3.1 Pro on SWE-Bench Pro (58.4 vs 57.3 / 57.7 / 54.2) as an open-weight…
GLM-5.1 在 SWE-Bench Pro 编程基准上拿了 58.4 分,比 Opus 4.6 的 57.3、GPT-5.4 的 57.7 和 Gemini 3.1 Pro 的 54.2 都高。模型是 MIT 协议开源的,权重公开。发帖人说开源和闭源的差距现在大概只剩六个月。不过正文没交代各家模型是不是在完全一样的条件下跑的,也没提测试成本和复现细...
推荐理由:GLM-5.1 以开源权重身份在 SWE-Bench Pro 上超过三个闭源旗舰,分数差虽然不大,但够拿来讨论了。问题在于信息全来自一条推文,没给评测设置、运行成本、是否同条件对比,这些才是判断分数含金量的关键。我会先打个折,把这条当信号看,不当结论用。