# GPT 的安全训练没消除性别偏见，只是把它洗得更隐蔽了

> 原标题：Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

- 来源：Hacker News 首页
- 发布时间：2026-09-19T04:07:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57559
- 原文：https://arxiv.org/abs/2609.20779

## 摘要

这篇 EMNLP 2026 的论文直接给 GPT 系列做了个大体检，从 GPT-2 一路测到 GPT-5，总共分析了 45 万条按性别区分的模型补全结果。表面上看，毒性评分确实一代比一代低，但歧视只是换了张皮。GPT-2 时代针对女性的文本里常见的性暴力内容，到 GPT-4 基本消失了；可与此同时，针对男性的文本开始大量出现“会照顾人”“情感丰富”“男...

## 推荐理由

EMNLP 2026 的论文，实证底子厚，45 万条样本横跨 GPT 全系列，还造了个能让人记住的新概念“伤害洗白”。HKR 三项全中，但作为单篇论文而非产品发布，82 分封顶。我会先打个折：论文没披露 GPT-5 的具体测试条件，这点先别太激动。如果是真的，说明安全训练只是给歧视换了张皮，这个结论够从业者重新审视自己的评估体系了。

## 锐评

这篇 EMNLP 2026 的论文给 GPT 系列做了一次大体检，从 GPT-2 测到 GPT-5，分析了 45 万条按性别区分的模型补全结果。结论很直接：安全训练确实把脏话和暴力内容洗掉了，但歧视没有消失，只是换了一种更隐蔽的方式。作者管这叫“伤害洗白”（harm laundering）。

具体来说，GPT-2 时代针对女性的文本里常见的性暴力内容，到 GPT-4 基本清零。但与此同时，针对男性的文本开始大量出现“会照顾人”“情感丰富”“盟友身份”这类正面描述，而针对女性的文本没有获得同样的待遇。到 GPT-5，一个包含 1997 篇文档的话题簇直接把乳腺癌框定成男性权利辩论，女性侧则完全没有对等的话题。三个独立的毒性分类器都给这些内容打了“无毒”标签。另外，女性侧的话题多样性在 GPT-4 对齐边界处比男性侧低了 36%。

数字上有个值得注意的对比：衡量“表征伤害”的 REGARD 指标与模型发布时间正相关（ρ=+0.55），而毒性评分 Detoxify 与发布时间不相关（ρ=−0.23）。也就是说，毒性评分在降，表征伤害却在涨。论文据此提出了一套三步检测方案，用来抓这种洗白后的歧视。不过正文没披露这套方案在 GPT 系列之外的模型上验证效果如何，这点先别太激动。
