# Bebop：用拒绝采样做多token预测，把RL训练加速到1.8倍

> 原标题：Bebop：通过带拒绝采样的多token预测加速RL训练

- 来源：AI HOT 精选
- 发布时间：2026-06-10T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37541
- 原文：https://arxiv.org/abs/2606.12370

## 摘要

阿里团队发现，用多token预测（MTP，一次猜好几个词）来加速强化学习训练时，模型在RL阶段会越来越“犹豫”（熵升高），导致猜对的接受率直线下降。他们先把这个现象量化了：模型熵和接受率呈明显负线性关系。接着给了三个解法：一是把贪心采样换成概率拒绝采样，让草稿更稳；二是提出端到端的TV损失函数，直接优化多步接受率，能再提约10个百分点，最高到95%；三...

## 推荐理由

阿里这篇论文先讲了一个反直觉现象：用多token预测加速RL训练时，模型会越来越犹豫，草稿接受率直线往下掉。他们把这个现象量化成熵和接受率的负线性关系，然后给了两个解法——概率拒绝采样让草稿更稳，TV损失直接优化多步接受率，能把接受率从不到50%拉回95%。正文没提在Qwen3.5/3.6之外的大规模部署验证，所以我会先打个折，但问题抓得准、解法直接，对做RL训练的工程师来说很实用。

## 锐评

这篇论文解决了一个很实际的工程痛点：在强化学习（RL）训练大模型时，用多token预测（MTP，一次猜好几个词）来加速，效果会越来越差。阿里团队找到了根因——模型在RL阶段熵值升高，也就是输出变得越来越不确定、越来越“犹豫”，这直接导致猜对的接受率断崖式下跌。他们用数据量化了这种负线性关系，这点很扎实。

解法分三步，最核心的是把原来贪心的采样方式换成概率拒绝采样，让草稿更稳；同时提出一个叫端到端TV损失的新目标函数，直接优化多步接受率，能再提升约10个百分点，最高干到95%。在Qwen 3.5到3.7系列模型上，推理吞吐提升了25%，异步RL训练整体加速最高1.8倍，覆盖了数学推理、代码生成和智能体任务，验证范围比较广。

不过，正文没披露这套方法在更大规模模型（比如几百B参数）或更复杂的多轮对话RL场景下的表现。另外，1.8倍是端到端异步训练的加速比，实际业务中通信和调度开销可能会吃掉一部分收益，这点先别太激动。
