SWE-Bench Pro 测不出模型差距了,有人重做了一把尺子,分差直接拉到 62 个百分点
SWE-Bench Pro 饱和之后,有人做了一把新尺子
SWE-Bench Pro 的排行榜上,GPT-5.5 和 Claude Opus 4.7 都挤在 82 分附近,看起来差不多。但 Datacurve 团队新发布的 DeepSWE 基准,让同一批模型跑出了 62 个百分点的差距:GPT-5.5 拿了 70%,Claude Opus 4.7 是 54%,DeepSeek V4 Pro 只有 8%。差距拉...
推荐理由:我会先打个折:正文没披露 DeepSWE 的样本量、任务构成和评测流程细节,所以这把新尺子到底准不准还不好说。但它的价值在于把 SWE-Bench Pro 的遮羞布掀了——数据污染和 verifier 缺陷导致同一批模型结果能差 62 个百分点,说明老基准已经区分不出模型好坏。对正在选型代码 agent 的团队来说,这个信号比单纯刷榜有用,提醒大家别只看一个数字就下结论。