研究称仅训练Transformer单层即可匹敌全参RL效果

明尼苏达大学、北京大学和亚马逊的联合研究发现,Transformer强化学习适配的性能提升并非均匀分布,而是高度集中在少数中间层。研究提出“层贡献度”指标,并证实仅训练单个Transformer层即可在某些任务上匹敌全参数RL的效果,挑战了后训练应统一更新所有层的传统假设。

2026-07-08 ~ 2026-07-09 · 2 条相关

事件全程(共 2 集)→