# 阿里达摩院用信息瓶颈做自奖励，让模型做数学题时多试几条不同的路

> 原标题：ACL 2026｜打破推理同质化！阿里达摩院新作让RLVR从重复采样走向有效探索

- 来源：机器之心 · 公众号
- 发布时间：2026-05-14T04:10:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20825
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032918&idx=3&sn=e3d388c0aedc3f4eff95d652698adc99

## 摘要

阿里达摩院发了篇 ACL 2026 论文，提出 I²B-LPO，解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时，碰到它犹豫不决的节点就分叉出多条路径，再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题，准确率最多提了 5.3%，答案的语义多样性提了 7...

## 推荐理由

我会先打个折：这还是一篇训练方法论文，不是新模型或产品发布，所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”，而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在，准确率和多样性双涨，没有只挑好看的说。正文没披露训练成本和延迟数据，这点先别太激动。整体适合推荐给做推理微调的人看，不是那种看完就忘的刷榜文章。

## 锐评

这篇论文的核心思路挺直接：用强化学习微调模型做推理时，模型容易陷入“只会一种解法”的困境，生成一堆看起来不同但思路雷同的答案。达摩院的方案是在模型生成过程中，碰到它犹豫不决的节点就主动分叉出多条路径，再用一个基于信息瓶颈的自奖励机制筛掉重复的，留下真正不一样的解法。在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题，准确率最多提了 5.3%，答案的语义多样性提了 7.4%。

不过要冷静看几个点。第一，正文因为微信环境验证问题没完全加载，具体的实验设置、基准测试名称、对比基线都没披露，5.3% 这个数字是在什么条件下拿到的说不清楚。第二，分叉加筛选会增加推理时的计算开销，论文有没有给出延迟或成本数据，目前看不到。第三，这个方法在非数学推理任务上效果如何，也没提。如果后续能补上这些信息，判断会更踏实。
