NatureBench 实测:AI 编程智能体只在 17.8% 的顶刊任务上打赢了原论文的 SOTA
NatureBench:AI编码智能体能否匹配Nature系列论文已发表SOTA?
这篇论文搞了个叫 NatureBench 的基准测试,从 Nature 系列期刊已发表的论文里抽了 90 个跨学科任务,专门考 AI 编程智能体能不能复现甚至超越原论文的最优结果。测试时不让智能体上网查资料,结果最强的模型配置只在 17.8% 的任务上真正超过了原 SOTA(判定标准是提升幅度 g>0.1)。智能体赢的套路主要是把科学问题翻译成自己擅长...
推荐理由:NatureBench 从 Nature 系列已发表论文里抽了 90 个跨学科任务,让 AI 编码智能体在不联网的情况下复现甚至超越原 SOTA。结果最强配置只在 17.8% 的任务上真正胜出,而且赢的方式是把科学问题转成自己擅长的编程套路。这个基准设计够挑衅,数字也具体,但论文刚上 arXiv 还没同行评审,我会先打个折——实验设定和评判标准还需要更多验证。