# DeepMind 用在线学习加主动探索，把 RLHF 的数据效率提升了 10 倍

> 原标题：突破RLHF的规模化瓶颈 | DeepMind团队论文 | 数据利用效率极低 | 四种RLHF算法 | off-policy | 在线RLHF | 认知神经网络ENN | 信息导向探索 | 肯定性微调

- 来源：最佳拍档
- 发布时间：2026-04-11T23:00:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/2788
- 原文：https://www.youtube.com/watch?v=8K9ITsYPRcc

## 摘要

Google DeepMind 团队在 Gemma 9B 上做了一组实验，证明 RLHF 数据效率低不是算法本身不行，而是用法错了。他们对比了四种算法：离线 RLHF 需要约 20 万条偏好标注才能达到 55% 左右的胜率；而他们提出的在线 RLHF 加上信息导向探索，不到 2 万条标注就做到了同样的水平，数据效率提升超过 10 倍。信息导向探索的核心...

## 推荐理由

我会先打个折：反馈是用 Gemini 1.5 Pro 模拟的，不是真人标的，1000倍增益也只是在不超过100万条标注区间外推出来的。但方法论值得看——在线 RLHF 加信息导向探索，让模型自己挑该问什么，把标注预算花在刀刃上。这点先别太激动，但如果是真的挺省钱。

## 锐评

这篇论文的核心判断很直接：RLHF 数据效率低，不是技术路线错了，而是大家一直在用过时的离线数据训练新模型。DeepMind 团队在 Gemma 9B 上做了组消融实验，对比了四种算法。传统的离线 RLHF 需要约 20 万条偏好标注才能达到 55% 的胜率，而他们提出的在线 RLHF 加上“信息导向探索”，不到 2 万条标注就做到了同样的水平，数据效率提升超过 10 倍。团队甚至外推，在 100 万条标注的规模下，效率增益可能达到 1000 倍。

这里的关键技术点有两个。一是“肯定性微调”，在策略梯度里加一个微小的正向偏移，防止模型训着训着突然崩掉，成本很低但解决了在线训练的老大难问题。二是用“认知神经网络”来估算奖励模型对哪个回答最没把握，然后专门挑这种高不确定性的样本去问人类反馈，让每条标注都花在刀刃上。这套组合拳下来，参数增量不到总模型的 5%。

不过，这篇论文最大的限制在于，所有实验用的都是 Gemini 1.5 Pro 模拟的人类反馈，而不是真人标注。这就像用模拟考成绩来预测高考分数，方向可能对，但真实世界的噪声和偏好复杂性完全没被考虑进去。另外，正文没披露在更大规模模型上的验证结果，10 倍甚至 1000 倍的效率增益能否在千亿参数模型上复现，还是个未知数。
