# 只练一层 Transformer，效果就能追平全参数强化学习训练

> 原标题：Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train

- 来源：Hacker News 首页
- 发布时间：2026-07-02T12:10:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41931
- 原文：https://arxiv.org/abs/2607.01232

## 摘要

这篇论文发现，大模型做强化学习（RL）后训练时，大部分提升其实集中在中间几层。他们提出一个叫“层贡献”的指标，衡量单独训练某一层能追回多少全参数训练的效果。在 Qwen3、Qwen2.5 两个系列共七个模型上，用 GRPO、GiGPO、Dr. GRPO 三种 RL 算法，跑数学推理、代码生成和智能体决策任务，结果都指向同一个规律：只练中间某一层，就能恢...

## 推荐理由

这篇论文的核心发现很直接：大模型做强化学习后训练，大部分提升其实集中在中间几层，只练其中一层就能追回全参数训练的效果。他们在Qwen3、Qwen2.5两个系列共七个模型上，用GRPO、GiGPO、Dr. GRPO三种算法，跑数学推理、代码生成和智能体决策任务，结果都指向同一个规律。这个结论对正在做RL微调的团队来说，意味着可以大幅砍掉训练参数量，省算力、省时间。不过我得先打个折：目前只是arXiv预印本，还没经过同行评审，实验细节和泛化性还需要更多验证。另外正文没披露训练一层相比全参数训练具体省了多少算力或时间，这点如果能补上，说服力会更强。

## 锐评

这篇论文给了一个很反直觉的发现：大模型做强化学习（RL）后训练，不用动全部参数，只练中间某一层就能拿到几乎全部收益，有时甚至更好。他们定义了一个叫“层贡献”的指标，衡量单独训练某一层能追回多少全参数训练的效果。在 Qwen3、Qwen2.5 两个系列共七个模型上，用 GRPO、GiGPO、Dr. GRPO 三种 RL 算法，跑数学推理、代码生成和智能体决策任务，结果都指向同一个规律：中间层贡献最大，靠近输入和输出的层贡献很小。而且这个层贡献的排序，在不同数据集、任务、模型家族和算法之间高度相关，说明这不是某个模型的特例。

如果这个结论能稳定复现，那 RL 后训练的成本可以大幅降低——只更新一层参数，显存和计算量都会少很多。但论文目前只给了效果对比，没给出具体的算力节省数字，也没讨论只练一层会不会在更复杂的多轮对话或长文本任务上掉链子。另外，他们用的都是 Qwen 系列模型，换到其他架构（比如非 MoE 的密集模型）是否还成立，正文也没验证。这点先别太激动，等更多模型上的复现结果出来再看。
