# OpenAI 自查 ChatGPT 有没有看人下菜碟：用名字测偏见，整体翻车率约 0.1%

> 原标题：Evaluating fairness in ChatGPT

- 来源：OpenAI News
- 发布时间：2024-10-15T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/690
- 原文：https://openai.com/index/evaluating-fairness-in-chatgpt

## 摘要

OpenAI 拿几百万条 ChatGPT 的真实对话做了次内部体检，想看看用户的名字会不会触发有害的刻板印象。他们让 GPT-4o 当“隐私保护评审员”去读聊天记录、找规律，研究员看不到原始对话。结果发现，ChatGPT 的回答质量不会因为名字暗示的性别或种族而变差，但确实有大约 0.1% 的情况，名字会引出有害偏见。在写故事这类开放任务里，出问题的概...

## 推荐理由

OpenAI 拿数百万条真实 ChatGPT 请求做了一次公平性审计，这种事很少见。我会先打个折：整体有害刻板印象发生率约 0.1%，看着很低，但研究也坦白种族相关判定的一致率不如性别高，这点先别太激动。真正该盯的是旧模型——GPT-3.5 Turbo 在分任务评测里偏差最明显，说明模型升级确实在压这个问题。研究用 GPT-4o 当隐私保护评审器，省了人工成本，但正文没披露评审器本身有没有系统性偏见。整体是一份有数据、有对比、有保留的工程报告，不是公关稿。

## 锐评

这篇研究最实在的地方是它没在实验室里自说自话，而是直接分析了 ChatGPT 的真实聊天记录。为了保护隐私，他们让 GPT-4o 当“评审员”去读对话、找规律，研究员看不到原始内容。这个方法本身挺聪明，但有个硬伤：GPT-4o 判断种族相关的偏见时，和人类评审员的一致性明显低于性别判断（性别一致率超 90%，种族没给具体数字，只说更低）。所以那 0.1% 的有害偏见率，在种族维度上可能被低估了。

另一个值得注意的信号是模型版本之间的漂移。GPT-3.5 Turbo 在任务层面的偏见最明显，说明老模型更容易在开放任务（比如写故事）里因为一个名字就拐到刻板印象上。正文没披露 GPT-4 或 4o 的具体对比数据，这点缺得让人心痒。另外，研究只测了“名字”这一个身份信号，没碰口音、用词习惯这些更复杂的线索，结论不能直接推广到所有用户场景。
