# NatureBench 实测：AI 编程智能体只在 17.8% 的顶刊任务上打赢了原论文的 SOTA

> 原标题：NatureBench：AI编码智能体能否匹配Nature系列论文已发表SOTA？

- 来源：AI HOT 精选
- 发布时间：2026-06-23T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40164
- 原文：https://arxiv.org/abs/2606.24530

## 摘要

这篇论文搞了个叫 NatureBench 的基准测试，从 Nature 系列期刊已发表的论文里抽了 90 个跨学科任务，专门考 AI 编程智能体能不能复现甚至超越原论文的最优结果。测试时不让智能体上网查资料，结果最强的模型配置只在 17.8% 的任务上真正超过了原 SOTA（判定标准是提升幅度 g>0.1）。智能体赢的套路主要是把科学问题翻译成自己擅长...

## 推荐理由

NatureBench 从 Nature 系列已发表论文里抽了 90 个跨学科任务，让 AI 编码智能体在不联网的情况下复现甚至超越原 SOTA。结果最强配置只在 17.8% 的任务上真正胜出，而且赢的方式是把科学问题转成自己擅长的编程套路。这个基准设计够挑衅，数字也具体，但论文刚上 arXiv 还没同行评审，我会先打个折——实验设定和评判标准还需要更多验证。

## 锐评

这篇论文给AI编程智能体设了个硬核考场：从Nature系列已发表论文里抽了90个跨学科任务，让它们在不联网查资料的前提下，复现甚至超越原论文的最优结果。最强的模型配置只在17.8%的任务上真正胜出，判定标准是提升幅度超过0.1。这个数字说明，现在的AI离“独立搞科研”还差得远。

智能体赢的路径很取巧，主要是把各种科学问题翻译成自己擅长的监督学习套路，而不是靠真正的科学洞察或方法创新。输的原因里，大头是选错了方法或算力不够，倒不是没读懂任务。这暴露了一个关键短板：模型在陌生领域缺乏判断“该用什么方法”的元能力。

不过，这个基准本身也有局限。90个任务样本量不算大，而且禁止联网搜索，相当于捆住AI一只手去和全副武装的原论文比。如果开放联网，结果可能会好看些，但那就测不出模型自身的推理和创新能力了。论文公开了代码和排行榜，后续可以盯着看各家模型在这个硬指标上能刷到多少分。
