# OpenAI 发了个 PaperBench，专门考 AI 能不能复现顶会论文

> 原标题：PaperBench: Evaluating AI’s Ability to Replicate AI Research

- 来源：OpenAI News
- 发布时间：2025-04-02T10:15:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/590
- 原文：https://openai.com/index/paperbench

## 摘要

OpenAI 搞了个新基准测试 PaperBench，让 AI 智能体从零复现 20 篇 ICML 2024 的 Spotlight 和 Oral 论文，包括读懂论文、搭代码、跑实验。每篇论文的复现任务被拆成可打分的小步骤，总共 8,316 个，评分标准是跟论文原作者一起定的。目前表现最好的选手——Claude 3.5 Sonnet（新版）加上开源脚手...

## 推荐理由

OpenAI 扔出一个硬核基准 PaperBench，拿 20 篇 ICML 2024 的 Spotlight 和 Oral 论文当考题，让 AI 智能体去复现研究过程。不是简单问答，而是拆成 8,316 个可评分的子任务，评分标准还是找论文原作者一起建的，这点挺扎实。目前表现最好的是 Claude 3.5 Sonnet 搭配开源脚手架，平均复现得分 21.0%，但人类博士基线还没被超过，说明离真正能搞研究的 AI 还有明显距离。代码已开源，想自己测的可以直接跑。

## 锐评

OpenAI 发布的 PaperBench 是一个很实在的基准：让 AI 智能体从零复现 20 篇 ICML 2024 的 Spotlight 和 Oral 论文，包括读懂论文、搭代码、跑实验。每篇论文的复现任务被拆成可打分的小步骤，总共 8,316 个，评分标准是跟论文原作者一起定的。目前表现最好的选手——Claude 3.5 Sonnet（新版）加上开源脚手架，平均复现得分只有 21.0%。OpenAI 还找了顶尖 ML 博士生来做同一批题，模型没打过人类。

这个分数说明现在的模型离独立做研究还差得远。21% 意味着大部分步骤要么没做对，要么根本没完成。但要注意，这个基准只测了 ICML 2024 的论文，时效性很强，模型有没有见过这些论文的训练数据，正文没明确说。如果训练数据里已经包含了这些论文，那 21% 的成绩还要再打个折。

代码已经开源了，这点挺好，别人可以拿去复现和验证。但自动评分用的是另一个 LLM 当裁判，裁判本身准不准，正文说他们另外做了个基准来评估，但具体偏差多大没展开。如果裁判自己也有系统性误判，那 21% 这个数字的可靠性就要再掂量一下。
