# OpenAI 审计 SWE-Bench Pro，发现约三成题目本身有毛病

> 原标题：Separating signal from noise in coding evaluations

- 来源：OpenAI News
- 发布时间：2026-07-08T13:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43253
- 原文：https://openai.com/index/separating-signal-from-noise-coding-evaluations

## 摘要

OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查，估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目，再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道（34.1%）有缺陷的题目，主要毛病是测试太死板、题目描述漏要求、测试覆盖不足，以及题目描述误导模型。Op...

## 推荐理由

OpenAI 对 SWE-Bench Pro 做了一次质量审计，发现约 34% 的题目有缺陷，这个比例逼着行业重新审视编程评测的可靠性。文章给出了具体的缺陷分类和一套人机结合的复核流程，不是空喊评测有问题。没给更高分是因为这本质上是一份基准质量报告，不是模型能力突破或产品发布，但它的警示作用对从业者很实在。

## 锐评

OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查，结论是里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目，再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道（34.1%）有缺陷的题目，主要毛病是测试太死板、题目描述漏要求、测试覆盖不足，以及题目描述误导模型。

这个比例不低，意味着之前很多模型在这个榜单上的高分可能掺了水分。OpenAI 自己也说，八个月内前沿模型在 731 道公开题上的通过率从 23.3% 涨到 80.3%，现在回头看，这个涨幅里有多少是模型真变强了、多少是题目本身有漏洞，需要打个问号。

不过这篇公告没给出修复时间表，也没说会不会发布修正后的数据集。他们只是建议模型开发者别光盯着排行榜分数，要自己仔细检查结果。另外，审查流程里用 agent 来辅助查错这点挺实际，说明让模型干活去检查给模型用的考题，这条路走得通。
