只练一层 Transformer,效果就能追平全参数强化学习训练
Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train
这篇论文发现,大模型做强化学习(RL)后训练时,大部分提升其实集中在中间几层。他们提出一个叫“层贡献”的指标,衡量单独训练某一层能追回多少全参数训练的效果。在 Qwen3、Qwen2.5 两个系列共七个模型上,用 GRPO、GiGPO、Dr. GRPO 三种 RL 算法,跑数学推理、代码生成和智能体决策任务,结果都指向同一个规律:只练中间某一层,就能恢...
推荐理由:这篇论文的核心发现很直接:大模型做强化学习后训练,大部分提升其实集中在中间几层,只练其中一层就能追回全参数训练的效果。他们在Qwen3、Qwen2.5两个系列共七个模型上,用GRPO、GiGPO、Dr. GRPO三种算法,跑数学推理、代码生成和智能体决策任务,结果都指向同一个规律。这个结论对正在做RL微调的团队来说,意味着可以大幅砍掉训练参数量,省算力、省时间。不过我得先打个折:目前只是arXiv预印本,还没经过同行评审,实验细节和泛化性还需要更多验证。另外正文没披露训练一层相比全参数训练具体省了多少算力或时间,这点如果能补上,说服力会更强。