# OpenAI 发布 LifeSciBench：由博士科学家出题、审题，专门考模型做真实科研任务的基准

> 原标题：Introducing LifeSciBench

- 来源：OpenAI News
- 发布时间：2026-06-17T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39027
- 原文：https://openai.com/index/introducing-life-sci-bench

## 摘要

OpenAI 放出了一个叫 LifeSciBench 的基准，750 道题全由有生物技术或制药行业经验的博士科学家出题和审题。它不考知识点背诵，考的是模型能不能干真实的科研活儿：比如解读互相矛盾的实验证据、设计实验方案、评估药物从实验室到临床的风险。53% 的题需要模型去读附带的图表、序列文件等材料，平均每道题要经过 4 步推理。评分也不只看最终答案对...

## 推荐理由

OpenAI放出了一个由博士科学家出题的基准，750道题考的是实验设计、矛盾证据解读和转化风险评估，比现有基准更接近真实科研工作。分数没给更高是因为目前只有预印本，正文没披露模型在这个基准上的具体表现数据，也没说后续会不会持续更新题目，所以先打个折。

## 锐评

这个基准的出发点挺实在：科研不是做选择题，而是解读互相打架的实验数据、设计实验、评估药物从实验室到临床的风险。所以题目设计上，53% 的题需要模型去读图表、序列文件这些附件，平均每道题要经过 4 步推理，评分标准平均有 25 条，不光看答案对不对，还看论证过程、细节和格式是不是科学家想要的。出题和审题的人都是生物技术或制药行业里有博士学位的从业者，审稿人之间至少 90% 同意才收题，这个门槛不低。

但最大的信息缺口也很明显：OpenAI 没给任何模型的成绩。一个基准好不好用，最终要看它能不能拉开模型差距、分数和实际科研产出有没有关联。现在只有设计描述，没有数据验证，所以这个基准到底有多难、能测出什么，还得等第三方跑分或者 OpenAI 自己放结果。如果是真的能区分出模型在复杂科研任务上的能力，对药企选模型会有参考价值。
