LoRA 初始化一直被做错,SVD 初始化可加速 RL 训练收敛
burny_tech · x · 2026-09-17
Trajectory 团队发现社区普遍采用的 LoRA 权重初始化方式是次优的:改用权重矩阵的奇异值分解(SVD)来同时确定冻结权重与 LoRA 初始化,可以让 RL 训练收敛更快。该工作是 PiSSA 的扩展,团队在探索 agent RL 中可训练几何形状选择时得出此结论。
所属事件:SVD 初始化 LoRA 可加速 RL 训练收敛(2 条相关)→
「研究」频道最新
- AI 模拟 1930 年人脑,做「时间机器」社会实验 — iyadrahwan · 2026-09-17
- 英伟达办 V2D 挑战赛:让机器人从视频学技能 — YunzhuLiYZ · 2026-09-17
- 清华提出 CERA-MoA:路由器与智能体协同进化的强化学习框架 — Tsinghua · 2026-09-17
- 流式 ASR 为何一本正经胡说:数字人名错译的等待式解码思路 — Sinver_Nightingale27 · 2026-09-17
- 在线逆优化新算法达 O(d) 遗憾界,引出冷门 agentic 框架 Cogentic — IgorCarron · 2026-09-17
- AndroidLife 实测:Qwen3.8-27b 操作真手机 60 任务成功率仅 56.7% — East-Muffin-6472 · 2026-09-17