用 SVD top-k 初始化 LoRA 适配器,还能改善下游 RL 训练

simonguozirui · x · 2026-09-17

Trajectory Labs 团队分享了一项实践研究:将 LoRA 适配器用预训练权重 top-k SVD 分量初始化(即 PiSSA,2024),此前已知对 SFT 有益,他们现在证明这同样能改善下游 RL 训练效果。该想法最早来自 John Schulman 的《LoRA Without Regret》博客。团队发布了带可视化讲解的博客说明初始化为何重要,并已将代码合入 SkyRL,读者可自行复现实验。作者还指出后续方向:LoRA-GA 值得关注,在对齐方面或许可以选取与对齐重要方向正交的训练方向。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →