# SWE-Bench Pro 测不出模型差距了，有人重做了一把尺子，分差直接拉到 62 个百分点

> 原标题：SWE-Bench Pro 饱和之后，有人做了一把新尺子

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-05-28T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29690
- 原文：https://yage.ai/share/deepswe-benchmark-audit-20260528.html

## 摘要

SWE-Bench Pro 的排行榜上，GPT-5.5 和 Claude Opus 4.7 都挤在 82 分附近，看起来差不多。但 Datacurve 团队新发布的 DeepSWE 基准，让同一批模型跑出了 62 个百分点的差距：GPT-5.5 拿了 70%，Claude Opus 4.7 是 54%，DeepSeek V4 Pro 只有 8%。差距拉...

## 推荐理由

我会先打个折：正文没披露 DeepSWE 的样本量、任务构成和评测流程细节，所以这把新尺子到底准不准还不好说。但它的价值在于把 SWE-Bench Pro 的遮羞布掀了——数据污染和 verifier 缺陷导致同一批模型结果能差 62 个百分点，说明老基准已经区分不出模型好坏。对正在选型代码 agent 的团队来说，这个信号比单纯刷榜有用，提醒大家别只看一个数字就下结论。

## 锐评

这条新闻值得看，因为它解释了一个很多人都有但说不清的体感：排行榜上 GPT 和 Claude 差不多，用起来差距明显。Datacurve 团队发现旧基准 SWE-Bench Pro 有两个硬伤。一是题目答案早就在公开代码库里，模型可能背过答案了，OpenAI 自己都证实过这事。二是评分方式太死板，只要你的代码结构和标准答案长得不一样，哪怕功能完全正确也判错，误判率高达 24%。

DeepSWE 的改进很直接：题目全部人工新写，暂时防住了泄漏；评分只看最终效果，不管你中间怎么实现，误判率压到了 1.1%。结果同一批模型跑出了 62 个百分点的差距，GPT-5.5 拿了 70%，DeepSeek V4 Pro 只有 8%。这个区分度更接近日常使用体感。

但别急着把它当圣经。总共才 113 道题，样本量太小，分数波动会很大。而且题目已经公开了，下一代模型训练时大概率会吃进去，防泄漏效果是一次性的。另外所有模型都被迫用同一套工具接口，这对习惯不同工具的模型可能不公平。正文没披露测试跑了多少轮，也没说置信区间，这些数字的稳定性还得再观察。
