# OpenAI 发布 HealthBench：找 262 位医生写了 5 千条对话的评分标准，但打分还是交给模型

> 原标题：Introducing HealthBench

- 来源：OpenAI News
- 发布时间：2025-05-12T10:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/560
- 原文：https://openai.com/index/healthbench

## 摘要

OpenAI 搞了一个叫 HealthBench 的医疗 AI 评测基准。他们拉了 262 位在 60 个国家行过医的医生，一起设计了 5,000 段贴近现实的医患或医生间多轮对话，并且让医生为每条对话手写了评分细则，总共 48,562 条标准。评测时，模型先针对对话最后一条消息生成回答，再由 GPT‑4.1 这个“评分模型”逐条检查回答是否满足医生定...

## 推荐理由

HKR-K 来自具体的基准设计和已公开的产物：5,000 段对话、262 名医生覆盖 60 个国家、48,562 条评分标准，论文和代码都有。HKR-H 靠的是医生把判断写成可计分标准这个设计本身，HKR-R 则卡在医疗安全与模型当裁判的争议点上，所以给 featured。

## 锐评

OpenAI 发布了 HealthBench，一个用来考校 AI 看病聊天水平的基准。他们找了 262 位在 60 个国家行过医的医生，攒了 5,000 段贴近现实的医患或医生间多轮对话，并让医生手写了 48,562 条评分细则。模型回答后，由 GPT‑4.1 这个“评分模型”逐条检查回答是否满足医生定的标准。

这个设计的亮点是评分标准来自真人医生，比纯靠选择题或模糊打分更贴近临床判断。但要注意，最终打分员还是 GPT‑4.1，不是真人医生复核。这意味着分数反映的是“模型觉得另一个模型有没有按医生要求回答”，而不是医生直接认可了回答。OpenAI 在文章里也承认了这一点，但没给出模型评分员和真人评分员之间的一致性数据，这是个关键缺口。

另外，正文没披露具体模型的得分和排名，只说“分享了几款模型的表现，设了个新基线”。如果你是想看 GPT‑4o 或 o1 在医疗场景下到底行不行，这篇公告给不了你答案，得去翻他们附带的论文。
