#AI
RL 训练增益高度集中在中间层,单层 Transformer 可匹配全参数效果
一篇提交至 arXiv 的新论文对当前 LLM 后训练的主流做法提出了挑战。研究者对七个模型(涵盖 Qwen3、Qwen2.5 两个模型家族)、三种 RL 算法(GRPO、GiGPO、Dr. GRPO)以及数学推理、代码生成、智能体决策等多个任务域进行了系统性逐层分析,发现 RL 训练的增益高度集中在一个极小的子集上——在许多情况下,仅更新单一 Transformer 层就能恢复全参数 RL 训练的绝大部分收益,甚至在某些设置下超越全参数更新的效果。 研究引入了一个名为"层贡献度(layer contribution)"的量化指标,衡量单独训练某一层能恢复多少全参数 RL 训练的改进。实验结果呈现出一种惊人稳定的模式:高贡献度层集中分布在 Transformer 的中间层,而靠近输入和输出端的层贡献度显著偏低。更值得注意的是,这种层贡献度排名在不同数据集、任务、模型家族和 RL 算法之间保持了强相关性,表明这种结构模式具有相当的通用性。 这项发现对 AI 工业化有直接的成本意义:如果 RL 后训练的高成本算力消耗实际上大部分"浪费"在了贡献度低的层上,那么针对性地仅更新关键中间层,就能在不牺牲最终效果的前提下大幅压缩训练开销。
💡 为什么值得看RL 后训练增益高度集中于 Transformer 中间层,单层训练可匹敌全参数更新,有望降低算力成本。