新研究:训练单个Transformer层可媲美全参数RL训练

tokenbender · x · 2026-08-16

arXiv论文《Is One Layer Enough?》发现,在RL后训练中,训练单个Transformer层即可恢复全参数RL训练的大部分收益,有时甚至超越。跨7个模型、3种RL算法和多个任务域,高贡献层集中在中间40-60%的层。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →