DeepMind 用在线学习加主动探索,把 RLHF 的数据效率提升了 10 倍
突破RLHF的规模化瓶颈 | DeepMind团队论文 | 数据利用效率极低 | 四种RLHF算法 | off-policy | 在线RLHF | 认知神经网络ENN | 信息导向探索 | 肯定性微调
Google DeepMind 团队在 Gemma 9B 上做了一组实验,证明 RLHF 数据效率低不是算法本身不行,而是用法错了。他们对比了四种算法:离线 RLHF 需要约 20 万条偏好标注才能达到 55% 左右的胜率;而他们提出的在线 RLHF 加上信息导向探索,不到 2 万条标注就做到了同样的水平,数据效率提升超过 10 倍。信息导向探索的核心...
推荐理由:我会先打个折:反馈是用 Gemini 1.5 Pro 模拟的,不是真人标的,1000倍增益也只是在不超过100万条标注区间外推出来的。但方法论值得看——在线 RLHF 加信息导向探索,让模型自己挑该问什么,把标注预算花在刀刃上。这点先别太激动,但如果是真的挺省钱。