# OpenAI 自己解释为什么大模型总爱瞎编：评分标准在鼓励它猜，而不是说“不知道”

> 原标题：Why language models hallucinate

- 来源：OpenAI News
- 发布时间：2025-09-05T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/480
- 原文：https://openai.com/index/why-language-models-hallucinate

## 摘要

OpenAI 发了篇新论文，把大模型“幻觉”的锅扣在了训练和评测方式上。现在的考试只看最终答案对不对，模型瞎蒙一个还有概率撞对，老实说“不知道”反而直接零分。文章拿 SimpleQA 测试举例：gpt-5-thinking-mini 准确率 22%，但错误率只有 26%，因为它有 52% 的问题直接拒答了；而 OpenAI o4-mini 准确率 24...

## 推荐理由

这篇文章把幻觉归因到训练和评测的奖励机制上，不是老生常谈的“模型会犯错”。SimpleQA 那组数字把问题讲得很透：两个模型准确率只差两个点，但弃答率差了 51 个点，说明 o4-mini 的高错误率是被“鼓励瞎猜”逼出来的。对做对齐、安全和评测的人来说，这是个值得停下来想一想的信号。文章本身是研究解释类，不是产品发布或重大人事变动，所以放在 featured 而不是 p1。

## 锐评

这篇论文把大模型胡说八道的原因讲得很直白：不是模型故意骗人，而是我们训练和打分的方式在鼓励它蒙答案。现在的评测基本只看准确率，模型说“不知道”直接判零分，随便蒙一个还有 1/365 的概率撞对。长期下来，敢蒙的模型在排行榜上反而比谨慎的模型好看。

OpenAI 拿自家 SimpleQA 测试举了个例子：gpt-5-thinking-mini 准确率 22%，但错误率只有 26%，因为它有 52% 的问题直接拒答了；而老一点的 o4-mini 准确率 24%，看着略高，错误率却飙到 75%，拒答率只有 1%。这说明准确率这个指标会掩盖模型到底有多敢蒙。

不过这篇是 OpenAI 官网的博客文章，不是正式论文全文，正文没披露具体训练方法怎么改才能让模型学会拒答。它提了“谦逊”是公司价值观，也引了 Model Spec 里说该表达不确定性，但落到工程上怎么做、成本多高、对其它能力有没有副作用，这些都没展开。如果只看这篇，只能当个问题诊断来读，解法还得等后续技术报告。
