# OpenAI 发布 SWE-bench Verified：人工复核过的代码能力测试集

> 原标题：Introducing SWE-bench Verified

- 来源：OpenAI News
- 发布时间：2024-08-13T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/732
- 原文：https://openai.com/index/introducing-swe-bench-verified

## 摘要

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集，叫 SWE-bench Verified。他们发现原版测试有坑：单元测试太死板、问题描述含糊、环境搭不起来，导致明明对的代码被判错，会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日，头部智能体在原版 SWE-bench 上得分约 20%，在 SWE-bench...

## 推荐理由

这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍，点出三类硬伤，还给出了新的分数天花板。我会先打个折：正文没披露修正后的完整新榜单，但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

## 锐评

OpenAI 这次没发新模型，而是动手修了修考卷。他们发现 SWE-bench 这个流行的代码能力测试有不少“冤假错案”：单元测试卡得太死，跟要解决的问题对不上；问题描述写得太模糊，模型不知道到底该修什么；还有环境配置的锅，导致正确的代码跑不起来。这些坑会让模型得分系统性地偏低，截至 2024 年 8 月 5 日，头部智能体在原版上只有约 20% 的得分，但在更干净的 Lite 版上能到 43%。

所以他们拉上原作者，人工筛了一遍，搞出了 SWE-bench Verified 这个子集。具体怎么筛的、筛完还剩多少题、以及新基准下各家模型到底跑多少分，正文里没给具体数字，这点比较可惜，没法直接判断修正后的评估能有多大变化。

对从业者来说，这条消息的价值在于提醒：别光盯着排行榜上的绝对分数，得先看看考卷本身有没有问题。OpenAI 把这事放在“模型自主能力风险”的框架下讲，说明他们更担心的是低估模型能力导致安全准备不足。但反过来想，如果基准本身有系统性偏差，那之前基于原版分数做的所有能力对比和趋势判断，都得打个折扣重新审视。
