跳到正文
AI HOT 精选

OpenAI 公布 GPT-5.6 医疗评估:最小号 Luna 模型在最低推理档位就赢了 GPT-5.5,成本还低了 25 倍

OpenAI 发布 GPT-5.6 系列医疗评估结果

OpenAI 让专科医生不限时、可上网查资料来答题,再找其他医生盲评,从准确性、沟通、完整性、指令遵循和健康决策帮助性五个维度打了 20000 次分。所有 GPT-5.6 模型都明显超过医生,而且医生在 GPT-5.6 的回答里挑出的毛病比在同行写的回答里还少。最小的 GPT-5.6 Luna 只用最低推理强度就超过了最高推理强度的 GPT-5.5,成...

推荐理由:OpenAI 搞了一场两万次盲评,让 GPT-5.6 系列和专科医生正面比答题,医生不限时还能上网查。结果所有 GPT-5.6 模型都明显超过医生,最小的 Luna 用最低推理强度就干掉了 GPT-5.5 的最高强度,医生在同行回答里挑出的毛病比在模型回答里还多。我会先打个折:正文没披露医生具体专科分布和题目难度分层,但就凭这个实验设计和结果,已经够让医疗 AI 圈坐不住了。

读原文 ↗导出 Markdown