OpenAI 正经解释 GPT-5.5 为什么爱说“哥布林”
OpenAI公告正经解释:为什么GPT-5.5爱说“哥布林”
OpenAI 发公告说,GPT-5.5 老把“哥布林”挂嘴边,是因为训练时给“书呆子”人设的回复打了高分,这个偏好通过强化学习和后续训练扩散开了。GPT-5.1 之后,ChatGPT 用“哥布林”的频率涨了 175%;书呆子风格的回复只占总回复的 2.5%,却贡献了 66.7% 的“哥布林”出现次数。核心问题是奖励信号有偏差,在强化学习的采样和生成、以...
推荐理由:我会先打个折,这不是什么重大能力发布,但 OpenAI 自己复盘模型行为偏差的料很实在。核心就一件事:他们给模型加了“书呆子”人格的奖励信号,结果这信号通过 RL、rollouts 和 SFT 扩散到完全无关的场景,让 GPT-5.5 动不动就 cue 哥布林。数字摆在那——175% 的用量飙升,2.5% 的回复源头——说明偏差放大效应有多猛。对做对齐和微调的人来说,这是个活生生的警告:奖励函数里一个看似无害的偏好,最后能在产品里闹出笑话。正文没展开他们具体怎么修的,但光这个诊断过程就值得从业者盯一眼。