OpenAI 不再用 SWE-bench Verified 测前沿编程能力,因为题目和答案都被模型背过了
OpenAI 发了一篇文章,解释他们为什么停止用 SWE-bench Verified 这个基准来评估模型写代码的能力。他们抽查了 o3 模型跑了 64 次都没稳定通过的 138 道题,发现至少 59.4% 的题目本身有问题:要么测试用例太死板,把正确的代码也判错;要么题目描述太模糊,怎么改都通不过。更关键的是数据污染——他们测的主流前沿模型都能直接复...
推荐理由:OpenAI 用一份审计报告把 SWE-bench Verified 拉下神坛,不是单纯吐槽,而是拿出了 59.4% 题目有缺陷、所有模型都能撞到答案细节的污染证据。这对靠榜单说话的编程模型赛道是个实打实的信任危机,所以重要性给到 82。但毕竟不是新模型或产品发布,只是评测标准换代,分数没再往上拉。