跳到正文
Hacker News 首页

斯坦福发布 Terminal-Bench-Science:让科学家出题考 AI,目前最强模型正确率仅 30%

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

斯坦福团队搞了个新基准 Terminal-Bench-Science 0.1,专门测 AI 能不能干真实的科研活儿。题目不是教科书习题,而是由一线科学家从自己研究里抽出来的工作流程,覆盖生命科学、物理、地球科学、数学和工程。第一版从 920 个提案里只筛出 70 个任务,淘汰率很高,因为既要科学上有意思,又得难住现在的模型,还得能客观打分。目前成绩最好...

推荐理由:斯坦福这个 Terminal-Bench-Science 0.1 挺有意思,它不考模型背教科书,而是让一线科学家从自己研究里抽任务来出题,920 个提案只留下 70 个,筛选很狠。目前 Claude Opus 5 只能搞定 30%,说明真实科研对 AI 来说还很难。对做 agent 的人来说这是个硬核试金石,我会先打个折——70 个任务样本量不大,覆盖的学科也有限,但方向是对的,值得关注。

读原文 ↗导出 Markdown