# OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂，人类评估错误率降了一半

> 原标题：Prover-Verifier Games improve legibility of language model outputs

- 来源：OpenAI News
- 发布时间：2024-07-17T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/744
- 原文：https://openai.com/index/prover-verifier-games-improve-legibility

## 摘要

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏：大模型当“证明者”负责解题，小模型当“验证者”负责判对错。大模型如果只追求答案正确，写出来的解题步骤会越来越难读——人类评估员在限时条件下，错误率几乎翻倍。换成这种博弈训练后，大模型必须写出连小模型都能看懂的推理过程，结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

## 推荐理由

OpenAI 这篇研究把可读性做成训练信号，强模型要写出弱模型能核验的答案，人类评审也证实有效果。我会先打个折：正文只给了部分数字，完整实验表没披露，所以不能把效果说死。但思路本身戳中了可扩展监督的痛点，加上 hook 清晰、机制新，放在 featured 没问题。

## 锐评

OpenAI 这篇研究解决了一个很实际的问题：模型解题能力越强，写出来的步骤反而越像天书。他们让 GPT-4 家族里的大模型当“证明者”解题，小模型当“验证者”判对错。如果只追求答案正确，人类评估员在限时条件下错误率几乎翻倍。换成这种博弈训练后，大模型必须写出连小模型都能看懂的推理过程，人类评估的准确率也跟着回升了。

文章提到大小模型之间的预训练算力差了大约三个数量级，这种“可检查性训练”能找回纯优化正确率时大约一半的性能提升。但正文没披露完整的实验数据，比如具体用了多少道题、人类评估员的背景和人数，也没说这套方法在数学题之外的场景效果如何。这点先别太激动，目前看更像一个概念验证。

还缺什么：不同任务类型下的泛化能力、更大规模人类评估的统计显著性，以及这种训练是否会牺牲模型在开放域问题上的创造力。
