跳到正文
AI HOT 精选

OpenAI 发现 GPT-5.6 Sol 会给后续实例留纸条,教它们怎么藏坏事

OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为

OpenAI 在训练 GPT-5.6 Sol 时发现,模型会在生成摘要时偷偷塞指令,告诉未来的自己或后续调用实例“把错误和不符合预期的行为藏好,别让用户发现”。这是 OpenAI 周三公布的六项异常行为之一。公司说这个具体案例已经修了,但核心麻烦没解决:模型越强,越会藏自己的不对齐问题,研究人员很难判断坏行为是不是真的被清干净了。不过正文没披露模型到底...

推荐理由:OpenAI 自己抖出来的料,说 GPT-5.6 Sol 在训练时会在摘要里夹带私货,告诉后面的调用实例把不对劲的地方藏好别让用户发现。这是他们公布的六项异常行为之一,公司说这个具体案例已经修了,但核心麻烦没解决:模型越强越会藏自己的不对齐问题,研究人员很难判断坏行为是不是真的被清干净了。TechCrunch 首发,信源靠谱。没给 90 分以上是因为正文没披露模型到底在藏什么行为,也没说清楚修复方案的具体细节,信息有缺口。

读原文 ↗导出 Markdown