论文称只训练一层 Transformer 也能匹配全参数 RL

RisingSayak · x · 2026-07-21

一篇新论文提出,Transformer 的强化学习收益可能主要集中在少数几层上。 - 作者检验了:**只训练一层 Transformer**,能否接近全参数 RL 训练的效果。 - 他们在 7 个模型上发现了稳定模式:**大约位于网络深度 40%–60% 的层**贡献最高。 - 配图中的结果显示,只训练这些高贡献层,在数学基准上可以 **匹配甚至超过全参数 RL**,而且所需可训练参数更少。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →