OpenAI 审计 SWE-Bench Pro,发现约三成题目本身有毛病
Separating signal from noise in coding evaluations
OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查,估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目,再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道(34.1%)有缺陷的题目,主要毛病是测试太死板、题目描述漏要求、测试覆盖不足,以及题目描述误导模型。Op...
推荐理由:OpenAI 对 SWE-Bench Pro 做了一次质量审计,发现约 34% 的题目有缺陷,这个比例逼着行业重新审视编程评测的可靠性。文章给出了具体的缺陷分类和一套人机结合的复核流程,不是空喊评测有问题。没给更高分是因为这本质上是一份基准质量报告,不是模型能力突破或产品发布,但它的警示作用对从业者很实在。