OpenAI 发布 HealthBench:找 262 位医生写了 5 千条对话的评分标准,但打分还是交给模型
Introducing HealthBench
OpenAI 搞了一个叫 HealthBench 的医疗 AI 评测基准。他们拉了 262 位在 60 个国家行过医的医生,一起设计了 5,000 段贴近现实的医患或医生间多轮对话,并且让医生为每条对话手写了评分细则,总共 48,562 条标准。评测时,模型先针对对话最后一条消息生成回答,再由 GPT‑4.1 这个“评分模型”逐条检查回答是否满足医生定...
推荐理由:HKR-K 来自具体的基准设计和已公开的产物:5,000 段对话、262 名医生覆盖 60 个国家、48,562 条评分标准,论文和代码都有。HKR-H 靠的是医生把判断写成可计分标准这个设计本身,HKR-R 则卡在医疗安全与模型当裁判的争议点上,所以给 featured。