专题 · FULL STORY

研究称RL后训练仅需单层Transformer

联合研究发现大模型强化学习后训练无需全参更新,仅训练单个Transformer层即可媲美全参效果。后续研究进一步揭示性能提升高度集中在少数中间层,提出层贡献度指标予以证实。

2026-07-06 ~ 2026-07-09 · 2 集 · 4 条

第 1 集 · 研究发现大模型强化学习后训练仅需单层 Transformer(2026-07-06,2 条)

一项最新研究《Is One Layer Enough?》表明,对大语言模型进行强化学习(RL)后训练时,仅需在单个 Transformer 层上进行即可媲美全参数微调的效果。这一发现与传统需要“微调全模型”的直觉大相径庭,引发了 AI 社区关于模型优化机制与微调本质的深入讨论,也为降低 RL 训练成本提供了新思路。

第 2 集 · 研究称仅训练Transformer单层即可匹敌全参RL效果(2026-07-08,2 条)

明尼苏达大学、北京大学和亚马逊的联合研究发现,Transformer强化学习适配的性能提升并非均匀分布,而是高度集中在少数中间层。研究提出“层贡献度”指标,并证实仅训练单个Transformer层即可在某些任务上匹敌全参数RL的效果,挑战了后训练应统一更新所有层的传统假设。