# GPT-5.5 Instant 把前沿健康问答能力带给了免费用户，医生盲评得分比真人写的还高

> 原标题：GPT-5.5 Instant提升ChatGPT健康智能

- 来源：AI HOT 精选
- 发布时间：2026-06-18T11:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39206
- 原文：https://openai.com/index/improving-health-intelligence-in-chatgpt

## 摘要

OpenAI 把最新的 GPT-5.5 Instant 模型用在了 ChatGPT 的健康问答上，免费用户也能用。在 3500 条回复的盲评里，医生给它的准确性、沟通清晰度和完整性打分，比真人医生写的回答还高，而且更少出现漏掉危险信号、不追问背景这类问题。后台监控显示，过去两个月健康回复的事实错误率下降了 71%。这些提升靠的是模型本身变强，以及请医生...

## 推荐理由

OpenAI 把 GPT-5.5 Instant 塞进了 ChatGPT 的健康问答，免费用户也能用。在 3500 条回复的盲评里，医生给它的准确性、沟通清晰度和完整性打分，比真人医生写的回答还高，而且更少漏掉危险信号、不追问背景这类问题。后台监控显示过去两个月事实错误率下降了 71%。这些提升靠的是模型本身变强，以及请医生参与调优，但正文没披露医生参与的具体方式和样本覆盖的疾病范围，所以效果能不能泛化到所有健康场景还得打个问号。

## 锐评

OpenAI 说 GPT-5.5 Instant 在健康问答上进步很大，免费用户就能用。他们请医生做了个 3500 条回复的盲评，结果模型在准确性、沟通清晰度和完整性上的得分比真人医生写的回答还高，而且更少漏掉危险信号、不追问背景。后台监控也显示，过去两个月健康回复的事实错误率降了 71%。

这个结果挺直观，但得打个折。评测是 OpenAI 自己组织的，医生也是他们请的，评分标准怎么定的、医生之间打分一致性怎么样，正文都没细说。3500 条样本量不算大，能不能代表真实用户五花八门的问法，也要打个问号。另外，后台监控的“事实错误率”具体怎么定义、怎么测的，也没披露。

还缺什么？缺独立第三方的复现，缺真实临床环境下的安全性数据，也缺对“模型说错但看起来很有道理”这类更隐蔽错误的评估。健康建议容错率低，光靠内部评测还不够。
