研究称仅训练Transformer单层即可匹敌全参RL效果
明尼苏达大学、北京大学和亚马逊的联合研究发现,Transformer强化学习适配的性能提升并非均匀分布,而是高度集中在少数中间层。研究提出“层贡献度”指标,并证实仅训练单个Transformer层即可在某些任务上匹敌全参数RL的效果,挑战了后训练应统一更新所有层的传统假设。
2026-07-08 ~ 2026-07-09 · 2 条相关
- 第 1 集:研究发现大模型强化学习后训练仅需单层 Transformer(2026-07-06,2 条)
- 第 2 集:研究称仅训练Transformer单层即可匹敌全参RL效果(2026-07-08,2 条)
- 研究发现:仅训练单层即可匹敌全参数 RL — 机器之心 · 2026-07-08
- 单层训练可接近全参RL效果 — Zijian Zhang · 2026-07-09