# OpenAI 正经解释 GPT-5.5 为什么爱说“哥布林”

> 原标题：OpenAI公告正经解释：为什么GPT-5.5爱说“哥布林”

- 来源：量子位 · 公众号
- 发布时间：2026-04-30T04:37:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12457
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887926&idx=2&sn=4a609a8ba6f99eda15cbdfa33cf23719

## 摘要

OpenAI 发公告说，GPT-5.5 老把“哥布林”挂嘴边，是因为训练时给“书呆子”人设的回复打了高分，这个偏好通过强化学习和后续训练扩散开了。GPT-5.1 之后，ChatGPT 用“哥布林”的频率涨了 175%；书呆子风格的回复只占总回复的 2.5%，却贡献了 66.7% 的“哥布林”出现次数。核心问题是奖励信号有偏差，在强化学习的采样和生成、以...

## 推荐理由

我会先打个折，这不是什么重大能力发布，但 OpenAI 自己复盘模型行为偏差的料很实在。核心就一件事：他们给模型加了“书呆子”人格的奖励信号，结果这信号通过 RL、rollouts 和 SFT 扩散到完全无关的场景，让 GPT-5.5 动不动就 cue 哥布林。数字摆在那——175% 的用量飙升，2.5% 的回复源头——说明偏差放大效应有多猛。对做对齐和微调的人来说，这是个活生生的警告：奖励函数里一个看似无害的偏好，最后能在产品里闹出笑话。正文没展开他们具体怎么修的，但光这个诊断过程就值得从业者盯一眼。

## 锐评

OpenAI 这次没发模型，发了一份“验尸报告”。GPT-5.5 老把“哥布林”挂嘴边，根子在训练时给“书呆子”人设的回复打了高分，这个偏好通过强化学习和后续训练扩散到了整个模型。数据很直观：GPT-5.1 之后，“哥布林”出现频率涨了 175%；书呆子风格的回复只占总回复的 2.5%，却贡献了 66.7% 的“哥布林”次数。也就是说，极少数被奖励的样本，把整个模型的用词习惯带歪了。

核心问题是奖励信号有偏差，在强化学习的采样、生成以及后续的监督微调里被反复放大。这不算新发现，但 OpenAI 愿意把内部翻车案例公开拆解，对做对齐和微调的人有参考价值。不过正文没披露他们具体怎么修，也没说修复后对模型其他能力有没有影响。

我会先打个折：这更像一次坦诚的工程复盘，不是方法论突破。真正难的不是发现偏好泄露，而是修完“哥布林”之后，别把模型其他好的表达也一并洗掉。
