跳到正文
OpenAI News

OpenAI 发布 LifeSciBench:由博士科学家出题、审题,专门考模型做真实科研任务的基准

Introducing LifeSciBench

OpenAI 放出了一个叫 LifeSciBench 的基准,750 道题全由有生物技术或制药行业经验的博士科学家出题和审题。它不考知识点背诵,考的是模型能不能干真实的科研活儿:比如解读互相矛盾的实验证据、设计实验方案、评估药物从实验室到临床的风险。53% 的题需要模型去读附带的图表、序列文件等材料,平均每道题要经过 4 步推理。评分也不只看最终答案对...

推荐理由:OpenAI放出了一个由博士科学家出题的基准,750道题考的是实验设计、矛盾证据解读和转化风险评估,比现有基准更接近真实科研工作。分数没给更高是因为目前只有预印本,正文没披露模型在这个基准上的具体表现数据,也没说后续会不会持续更新题目,所以先打个折。

读原文 ↗导出 Markdown