# OpenAI 公布 GPT-5.6 医疗评估：最小号 Luna 模型在最低推理档位就赢了 GPT-5.5，成本还低了 25 倍

> 原标题：OpenAI 发布 GPT-5.6 系列医疗评估结果

- 来源：AI HOT 精选
- 发布时间：2026-07-11T16:46:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43774
- 原文：https://x.com/sama/status/2075985056846451123

## 摘要

OpenAI 让专科医生不限时、可上网查资料来答题，再找其他医生盲评，从准确性、沟通、完整性、指令遵循和健康决策帮助性五个维度打了 20000 次分。所有 GPT-5.6 模型都明显超过医生，而且医生在 GPT-5.6 的回答里挑出的毛病比在同行写的回答里还少。最小的 GPT-5.6 Luna 只用最低推理强度就超过了最高推理强度的 GPT-5.5，成...

## 推荐理由

OpenAI 搞了一场两万次盲评，让 GPT-5.6 系列和专科医生正面比答题，医生不限时还能上网查。结果所有 GPT-5.6 模型都明显超过医生，最小的 Luna 用最低推理强度就干掉了 GPT-5.5 的最高强度，医生在同行回答里挑出的毛病比在模型回答里还多。我会先打个折：正文没披露医生具体专科分布和题目难度分层，但就凭这个实验设计和结果，已经够让医疗 AI 圈坐不住了。

## 锐评

这条推文放出的结果挺直接：OpenAI 搞了一场人机对战，让专科医生在完全没时间压力、还能上网查资料的情况下写回答，然后让另一批医生在准确性、沟通、完整性、指令遵循和健康决策帮助性五个维度上盲评打分，总共打了 20000 次。所有 GPT-5.6 模型都明显超过医生，而且医生在 AI 写的回答里挑出的毛病比在同行写的回答里还少。最小的 GPT-5.6 Luna 只用最低推理强度就超过了最高推理强度的 GPT-5.5，成本还低了 25 倍，这点如果是真的挺省钱。最大的 Sol 则把天花板又往上推了一截。

但正文没披露测试覆盖了哪些疾病、专科医生具体来自什么科室、样本量分布如何。医疗评估最怕的就是任务太窄或者医生群体不具代表性，这些信息缺口让结论的泛化能力打了折扣。另外，盲评虽然比自评靠谱，但评分医生本身的知识水平和判断标准也没交代。我会先打个折，等看到完整报告里的病种构成和医生资质再说。
