跳到正文
OpenAI News

OpenAI 自查 ChatGPT 有没有看人下菜碟:用名字测偏见,整体翻车率约 0.1%

Evaluating fairness in ChatGPT

OpenAI 拿几百万条 ChatGPT 的真实对话做了次内部体检,想看看用户的名字会不会触发有害的刻板印象。他们让 GPT-4o 当“隐私保护评审员”去读聊天记录、找规律,研究员看不到原始对话。结果发现,ChatGPT 的回答质量不会因为名字暗示的性别或种族而变差,但确实有大约 0.1% 的情况,名字会引出有害偏见。在写故事这类开放任务里,出问题的概...

推荐理由:OpenAI 拿数百万条真实 ChatGPT 请求做了一次公平性审计,这种事很少见。我会先打个折:整体有害刻板印象发生率约 0.1%,看着很低,但研究也坦白种族相关判定的一致率不如性别高,这点先别太激动。真正该盯的是旧模型——GPT-3.5 Turbo 在分任务评测里偏差最明显,说明模型升级确实在压这个问题。研究用 GPT-4o 当隐私保护评审器,省了人工成本,但正文没披露评审器本身有没有系统性偏见。整体是一份有数据、有对比、有保留的工程报告,不是公关稿。

读原文 ↗导出 Markdown