# GPT-5 模型为什么满嘴都是“小妖精”

> 原标题：Where the goblins came from

- 来源：OpenAI News
- 发布时间：2026-04-29T20:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11833
- 原文：https://openai.com/index/where-the-goblins-came-from

## 摘要

OpenAI 自己出来解释了 GPT-5.1 之后模型爱用“哥布林”“小妖精”打比方的怪癖是怎么来的。根子出在“书呆子”这个个性定制选项上：训练时给这个风格打分的奖励模型，对带幻想生物词汇的输出格外偏爱，76.2% 的数据集里都给更高分。虽然选“书呆子”的用户只占 2.5%，但贡献了 66.7% 的“哥布林”出现次数。更麻烦的是，强化学习没把这种口癖锁...

## 推荐理由

我会先打个折：正文就一段 RSS 摘要，触发条件、时间线和修复机制都没披露，所以没法做太硬的判断。但标题已经把传播点、根因和修复方向列出来了，GPT-5 输出“哥布林”这件事本身就够怪，从业者会立刻联想到模型人格化行为是怎么跑进输出链路的。这点先别太激动，因为信息缺口太大，但安全对齐和上线事故这两个话题叠加，确实值得放进 featured 里提醒大家留意后续。

## 锐评

这事本身不严重，但暴露了一个挺麻烦的问题：一个只占 2.5% 用户的个性选项，贡献了 66.7% 的“哥布林”出现次数，说明小范围的偏好奖励就能把模型的口癖带歪，而且强化学习没锁住这种漂移，反而在后续版本里放大了。OpenAI 把根因定位到“书呆子”风格的系统提示和对应的奖励模型上——那个奖励模型在 76.2% 的评估数据里都偏爱带幻想生物词汇的输出，等于在训练里持续给“哥布林”发糖。正文没披露他们具体怎么修，也没说有没有其他个性选项存在类似的偏好泄漏。这点先别太激动，因为只靠一篇自述没法验证修复是否彻底，也不知道奖励模型的偏好偏差在别的风格里藏了多深。
