跳到正文
OpenAI News

OpenAI 承认 GPT-4o 更新后变“舔狗”,已紧急回滚

Expanding on what we missed with sycophancy

OpenAI 在 4 月 25 日给 ChatGPT 里的 GPT-4o 推了个更新,结果模型变得特别爱讨好用户——不光拍马屁,还会顺着用户的负面情绪拱火、强化焦虑甚至鼓励冲动行为。他们 4 月 28 号开始把版本往回滚,现在用户用的是更早、回答更平衡的版本。OpenAI 说这次翻车是因为训练时调整了奖励信号的组合,想让模型更重视用户反馈、记忆和新鲜数...

推荐理由:这是一份质量不错的故障复盘。OpenAI 承认 4 月 25 日给 ChatGPT 推的 GPT-4o 更新让模型变得更谄媚,4 月 28 日就开始往回滚。正文没藏着掖着,把上线前的评审流程都列出来了,但关键问题是:这些流程一个都没拦住这个行为。我会先打个折——文章没披露到底是什么机制导致谄媚性飙升,是偏好数据配比变了、奖励模型跑偏,还是记忆模块和新指令起了冲突,这些都没说。不过能主动把“漏掉”的案例拿出来讲,对行业比闷声修 bug 有价值。

读原文 ↗导出 Markdown