# 就算号称“无审查”的模型，也不敢把话说明白

> 原标题：Even 'uncensored' models can't say what they want

- 来源：Hacker News 首页
- 发布时间：2026-04-20T22:43:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6989
- 原文：https://morgin.ai/articles/even-uncensored-models-cant-say-what-they-want.html

## 摘要

Morgin.ai 用 4,442 个句子测试了 6 个预训练模型，发现即便是去掉拒绝机制的“无审查”模型，碰到敏感词时概率也会被大幅压低，差距从几百倍到约 1.6 万倍不等。他们管这叫“退缩”：模型不会拒绝回答，但会把敏感词的概率压到几乎为零。比如同一句话填空，Pythia-12B 首选“驱逐出境”，概率 23.27%；而 Qwen3.5-9B 把同...

## 推荐理由

这篇文章最值钱的地方是把“无审查”这个标签撕开给你看。它没讲拒答，而是讲预训练阶段词的概率分布就已经歪了——比如 qwen3.5-9b-base 把 deportation 排到第 506 位，概率只有 0.0014%。我会先打个折：这只是单篇研究博客，不是正式论文，样本和模型覆盖有限。但它的视角够刁，用 4,442 个上下文测出的 flinch 现象，比泛泛讨论“模型审查”实在得多。对从业者来说，提醒了一件事：别光盯着后训练的安全对齐，预训练数据的分布偏移才是更底层的坑。这点先别太激动，但值得跟。

## 锐评

Morgin.ai 这篇研究戳破了一个常见幻觉：以为去掉拒绝机制，模型就真能百无禁忌。他们用 4,442 个句子测试了 7 个预训练模型，发现即便是不设安全护栏的“无审查”模型，碰到敏感词时概率也会被大幅压低，他们管这叫“退缩”。比如同一个句子填空，Pythia-12B 首选“驱逐出境”，概率 23.27%；而 Qwen3.5-9B 把同一个词压到了第 506 位，概率仅 0.0014%，差距约 1.6 万倍。模型没拒绝你，只是悄悄把词藏起来了。

研究对比了不同模型的“退缩”程度，用六边形图展示在反华、反美、脏话、暴力等六类词上的表现。在 The Pile 这种未过滤数据上训练的 Pythia-12B 退缩最少，成了基准线；而谷歌的 Gemma 系列退缩更明显，且 Gemma-4 比 Gemma-2 在政治类词汇上反而有所放松。这说明退缩发生在预训练阶段，是数据筛选直接塑造的，不全是后期安全微调的锅。

文章没披露测试句子的具体构造方式，也没说明概率计算时是否排除了其他干扰因素。另外，退缩是否真的影响下游任务表现，还是仅仅改变了表面概率分布，这点正文也没给出验证。所以结论可以先收着：它揭示了预训练数据过滤的深层影响，但离“模型被阉割”的定论还差一步实际危害的证明。
