SVD 初始化 LoRA 可加速 RL 训练收敛
Trajectory 团队研究发现,社区普遍采用的 LoRA 权重初始化方式其实是次优的。改用预训练权重矩阵的奇异值分解(SVD)top-k 分量来同时确定冻结权重与 LoRA 初始化(即 2024 年提出的 PiSSA 方法),不仅能加速强化学习训练的收敛,还可改善下游 RL 训练效果。该方法此前已被证明对 SFT 有益,此次研究进一步扩展了其应用价值。
2026-09-17 ~ 2026-09-17 · 2 条相关
- 用 SVD top-k 初始化 LoRA 适配器,还能改善下游 RL 训练 — simonguozirui · 2026-09-17
- LoRA 初始化一直被做错,SVD 初始化可加速 RL 训练收敛 — burny_tech · 2026-09-17