OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半
OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。
推荐理由:OpenAI 让 GPT-4 家族的大模型当证明者、小模型当验证者进行博弈训练,人类评估错误率从翻倍降至一半,为可扩展监督提供了一条可迁移的训练思路。