# Hugging Face 用 1200 人加编程智能体复现了 2200 篇 ICML 论文，发现审稿人没空看的证明，复现时真查出了问题

> 原标题：What We Learned by Reproducing 2,200 papers from ICML

- 来源：Hugging Face 博客
- 发布时间：2026-08-13T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51133
- 原文：https://huggingface.co/blog/icml-2026-open-reproductions

## 摘要

Hugging Face 搞了一场 19 天的黑客松，1200 多人带着 Claude Code、Codex 这类编程智能体，把 ICML 2026 接收的论文挑了 2226 篇来复现，覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验，然后汇报结果。一篇拿了 spotlight 的论文，审稿人自己承认没仔细检查证明，结果在这次复现里被抓住了真实...

## 推荐理由

Hugging Face搞了场大规模复现实验，让编程智能体读论文、写代码、跑结果，还顺手揪出一篇spotlight论文的证明错误。我会先打个折：正文只给了标题和摘要，复现成功率、智能体具体怎么干活这些关键数据都没披露，所以别急着下结论说智能体审稿靠谱。但光是这个规模和那个审稿人漏掉的错误，就足够让学界捏把汗了。

## 锐评

Hugging Face 搞了一场 19 天的黑客松，1200 多人带着 Claude Code 这类编程智能体，把 ICML 2026 接收的论文挑了 2226 篇来复现，覆盖了大会近三分之一。他们让智能体读论文、写代码、跑实验，然后汇报结果。一篇拿了 spotlight 的论文，审稿人自己承认没仔细检查证明，结果在这次复现里被抓住了真实问题。

这个动作直接戳中了一个现实：顶会投稿量两年翻倍到 2.3 万篇，审稿人根本审不过来。智能体复现不是要替代人，而是暴露了现有评审流程的缺口——很多论文的验证工作其实没人做。

不过，正文没披露这 2226 篇里到底有多少篇复现失败、多少篇结果对不上。也没说智能体跑实验花了多少算力、成本多高。如果只是挑了几个典型案例，那说服力要打个折。另外，智能体自己写代码跑实验，会不会引入新的错误，这点也没展开。
