跳到正文
AI HOT 精选

Bebop:用拒绝采样做多token预测,把RL训练加速到1.8倍

Bebop:通过带拒绝采样的多token预测加速RL训练

阿里团队发现,用多token预测(MTP,一次猜好几个词)来加速强化学习训练时,模型在RL阶段会越来越“犹豫”(熵升高),导致猜对的接受率直线下降。他们先把这个现象量化了:模型熵和接受率呈明显负线性关系。接着给了三个解法:一是把贪心采样换成概率拒绝采样,让草稿更稳;二是提出端到端的TV损失函数,直接优化多步接受率,能再提约10个百分点,最高到95%;三...

推荐理由:阿里这篇论文先讲了一个反直觉现象:用多token预测加速RL训练时,模型会越来越犹豫,草稿接受率直线往下掉。他们把这个现象量化成熵和接受率的负线性关系,然后给了两个解法——概率拒绝采样让草稿更稳,TV损失直接优化多步接受率,能把接受率从不到50%拉回95%。正文没提在Qwen3.5/3.6之外的大规模部署验证,所以我会先打个折,但问题抓得准、解法直接,对做RL训练的工程师来说很实用。

读原文 ↗导出 Markdown