# 斯坦福发布 Terminal-Bench-Science：让科学家出题考 AI，目前最强模型正确率仅 30%

> 原标题：Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

- 来源：Hacker News 首页
- 发布时间：2026-08-28T00:06:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53257
- 原文：https://www.terminal-bench-science.ai/announcement

## 摘要

斯坦福团队搞了个新基准 Terminal-Bench-Science 0.1，专门测 AI 能不能干真实的科研活儿。题目不是教科书习题，而是由一线科学家从自己研究里抽出来的工作流程，覆盖生命科学、物理、地球科学、数学和工程。第一版从 920 个提案里只筛出 70 个任务，淘汰率很高，因为既要科学上有意思，又得难住现在的模型，还得能客观打分。目前成绩最好...

## 推荐理由

斯坦福这个 Terminal-Bench-Science 0.1 挺有意思，它不考模型背教科书，而是让一线科学家从自己研究里抽任务来出题，920 个提案只留下 70 个，筛选很狠。目前 Claude Opus 5 只能搞定 30%，说明真实科研对 AI 来说还很难。对做 agent 的人来说这是个硬核试金石，我会先打个折——70 个任务样本量不大，覆盖的学科也有限，但方向是对的，值得关注。

## 锐评

这个基准的出发点很实在：不让模型厂商自己出题考自己，而是让一线科学家从真实研究里抽任务来考 AI。第一版从 920 个提案里只筛出 70 个任务，淘汰率超过 92%，筛得狠是因为要求任务既要有科学价值，又得难住现有模型，还得能客观打分。目前成绩最好的是 Claude Opus 5，70 个任务里只解决了 30%，GPT-5.6 Sol 和 Claude Fable 5 分别只有 22.4% 和 21.4%。这些数字说明，哪怕是最强的模型，面对真实的科研工作流——比如数据分析、仿真、定理证明、信号处理——大部分还是搞不定。

值得留意的是，这个基准设计成持续更新的，科学家可以不断提交新任务，避免像很多老基准那样被模型刷爆后就没人用了。正文提到有 22 个国家 376 位贡献者参与，覆盖面不错，但没披露任务的具体难度分布和打分细节，也没说不同学科之间的成绩差异有多大。另外，30% 的解决率到底意味着模型卡在哪个环节——是理解任务意图、写代码、还是调试跑通——正文也没展开。这些缺口让人不好判断进步空间主要在工具能力还是推理能力上。
