# OpenAI 不再用 SWE-bench Verified 测前沿编程能力，因为题目和答案都被模型背过了

> 原标题：Why SWE-bench Verified no longer measures frontier coding capabilities

- 来源：Hacker News 首页
- 发布时间：2026-04-26T13:58:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10027
- 原文：https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/

## 摘要

OpenAI 发了一篇文章，解释他们为什么停止用 SWE-bench Verified 这个基准来评估模型写代码的能力。他们抽查了 o3 模型跑了 64 次都没稳定通过的 138 道题，发现至少 59.4% 的题目本身有问题：要么测试用例太死板，把正确的代码也判错；要么题目描述太模糊，怎么改都通不过。更关键的是数据污染——他们测的主流前沿模型都能直接复...

## 推荐理由

OpenAI 用一份审计报告把 SWE-bench Verified 拉下神坛，不是单纯吐槽，而是拿出了 59.4% 题目有缺陷、所有模型都能撞到答案细节的污染证据。这对靠榜单说话的编程模型赛道是个实打实的信任危机，所以重要性给到 82。但毕竟不是新模型或产品发布，只是评测标准换代，分数没再往上拉。

## 锐评

OpenAI 这次主动捅破了一层窗户纸：他们不再用 SWE-bench Verified 来标榜模型编程能力，因为基准本身已经烂了。他们抽查了 o3 跑了 64 次都没稳定通过的 138 道题，发现至少 59.4% 的题目测试用例有问题——要么太死板把正确代码判错，要么题目描述模糊到怎么改都通不过。更致命的是数据污染，他们测的主流前沿模型都能直接复现出原始的人类修复代码或题目细节，说明这些模型在训练时已经见过考题和答案了。OpenAI 还发现，见过题目的模型更容易蒙对，因为那些不严谨的测试用例恰好能被训练时见过的信息补上。所以他们建议改用 SWE-bench Pro，并呼吁社区一起搞新的、没被污染的评测。这篇文章没给出 SWE-bench Pro 的具体构造细节，也没披露他们自己模型在 Pro 上的表现，所以这个新基准到底靠不靠谱，还得等第三方验证。
