# OpenAI 开源了一个叫 SimpleQA 的事实性基准，专门测模型回答短问题的准确率

> 原标题：Introducing SimpleQA

- 来源：OpenAI News
- 发布时间：2024-10-30T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/681
- 原文：https://openai.com/index/introducing-simpleqa

## 摘要

OpenAI 放出了一个包含 4326 道题的基准 SimpleQA，题目都是简短、有明确答案的事实类问题，比如“2022 年世界杯荷兰对阿根廷，哪位荷兰球员打进了运动战进球”。每道题都经过两名独立 AI 训练师交叉验证，又抽了 1000 道题做第三方审计，发现答案一致率 94.4%，估算数据集本身的固有错误率在 3% 左右。这个基准的目标是给前沿模型...

## 推荐理由

OpenAI 开源了一个事实问答基准 SimpleQA，4,326 道题，专门测模型回答短事实的准确率和校准能力。我会先打个折：它叫“简单”，但实际是给前沿模型挖坑，GPT-4o 得分不到 40%，说明越强的模型越容易在这上面翻车。数据质量方面，两道人工交叉核验，1,000 题抽检一致率 94.4%，估算固有错误率约 3%，这点先别太激动，3% 的错题率意味着有些题本身可能就有争议或歧义。整体看，这不是一篇例行公事的论文发布，而是一个直接打中可靠性、校准和基准信任问题的动作。

## 锐评

OpenAI 开源了一个叫 SimpleQA 的事实性基准测试，里面有 4326 道题，全是那种答案明确、不会随时间变化的短问题，比如“2022 年世界杯荷兰对阿根廷，哪个荷兰球员打进了运动战进球”。他们让两个 AI 训练师独立出题和验证，又抽了 1000 道题做第三方审计，发现答案一致率 94.4%，估算数据集本身的固有错误率在 3% 左右。这个数字说明题目质量还行，但也不是完美无瑕。

这个基准最狠的地方在于，它专门挑那些会让前沿模型“胡说八道”的问题。OpenAI 自己说 GPT-4o 的正确率不到 40%，这直接点出了当前最强模型在简单事实面前依然容易翻车。他们用 ChatGPT 当裁判来批改答案，分“正确”“错误”“未尝试”三档，方法上不算新，但胜在简单直接。

不过，正文没披露其他家模型（比如 Claude 3.5 或 Gemini）在这上面的具体分数，也没说题目是怎么从海量候选中筛出来的，只提了要能诱发 GPT-4o 或 GPT-3.5 的幻觉。所以这个基准到底是对所有模型都难，还是主要针对 OpenAI 自家模型的弱点，这点还不好说。
