研究发现:仅训练单层即可匹敌全参数 RL
机器之心 · wechat · 2026-07-08
明尼苏达大学、北京大学和亚马逊的团队挑战了“RL 后训练应统一更新所有 Transformer 层”的隐含假设。研究者提出“层贡献度”指标,发现 RL 收益高度集中在少数中间层。在 Qwen3-1.7B 上,仅训练第 10 层就能恢复全参数 RL 114% 的收益,而最弱的层仅恢复 28%,最好与最差层相差超 4 倍。
实验覆盖 7 个模型、2 个模型家族、3 种 RL 算法(GRPO/Dr.GRPO/GiGPO),以及数学推理、代码生成和智能体决策三类任务。论文表明,基于该发现的单层训练策略可持续超越标准全参数 RL 训练,为 RL 后训练的算法设计提供了新思路。
所属事件:研究称仅训练Transformer单层即可匹敌全参RL效果(2 条相关)→
「研究」频道最新
- ETH 研究:写作能力与 CS 功底是 vibe coding 成功的关键预测因素 — soumitrashukla9 · 2026-09-06
- 用户称 GPT-6 Astra 一夜攻克其研究组一个月未解的 Seymour 猜想定理 — morqon · 2026-09-06
- NoMagic 研究者:机器人泛化到 99% 也只能省一半任务成本 — m_wulfmeier · 2026-09-06
- 8年研究:LLM 表征隐含符号结构,泛化与乘法式编码相关 — jm_alexia · 2026-09-06
- PaperCompiler:把论文证据编译成文件级规格,杜绝论文复现代码丢细节 — mohitban47 · 2026-09-06
- 仅需 3 条新数据,基础模型把热导率误差从 47% 降到 2% — bravo_abad · 2026-09-06