哈佛急诊分诊试验:OpenAI o1 诊断准确率 67%,比医生高出 12-17 个百分点
OpenAI's o1 correctly diagnosed 67% of ER patients vs. 50-55% by triage doctors
哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者,而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小,但正文没披露样本量、病例构成和具体评估方法,所以数字本身只能当个方向参考。模型是在结构化信息里做判断,和医生在嘈杂急诊室里干活的条件完全不一样,直接比准确率会高估模型的实际可用性...
推荐理由:HKR 三项都成立:急诊分诊是高 stakes 场景,67% vs 50–55% 给了一个可讨论的数字,临床信任和职业边界问题自带传播力。但样本量和测试条件全没披露,所以分数压在 78–84 区间,不给 P1。