# 哈佛急诊分诊试验：OpenAI o1 诊断准确率 67%，比医生高出 12-17 个百分点

> 原标题：OpenAI's o1 correctly diagnosed 67% of ER patients vs. 50-55% by triage doctors

- 来源：Hacker News 首页
- 发布时间：2026-05-03T00:30:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13176
- 原文：https://www.theguardian.com/technology/2026/apr/30/ai-outperforms-doctors-in-harvard-trial-of-emergency-triage-diagnoses

## 摘要

哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者，而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小，但正文没披露样本量、病例构成和具体评估方法，所以数字本身只能当个方向参考。模型是在结构化信息里做判断，和医生在嘈杂急诊室里干活的条件完全不一样，直接比准确率会高估模型的实际可用性...

## 推荐理由

HKR 三项都成立：急诊分诊是高 stakes 场景，67% vs 50–55% 给了一个可讨论的数字，临床信任和职业边界问题自带传播力。但样本量和测试条件全没披露，所以分数压在 78–84 区间，不给 P1。

## 锐评

哈佛这项试验让 OpenAI 的 o1 模型和真人分诊医生比诊断准确率，结果是 67% 对 50-55%。差距看着不小，但报道没披露到底测了多少病例、病种怎么分布、用什么标准判定“正确诊断”。这些信息直接决定数字能不能当真。

更关键的是，模型是在结构化信息里做判断，医生是在嘈杂、多任务、信息不全的急诊室里干活，两种工作条件完全不一样。直接比准确率会高估模型在实际场景里的可用性。另外，分诊不只是给诊断，还要判断紧急程度、分配资源，这些维度这次测试有没有覆盖，正文也没说。

这条新闻的价值在于方向——大模型在标准化诊断任务上确实在逼近甚至超过人类平均水平。但离“AI 能替急诊医生”还差着临床验证、安全边界和真实环境测试好几步，别看到 67% 就激动。
