LoRA 收敛慢有救了:新研究直击随机降投影的优化缺陷

burkov · x · 2026-09-07

Andriy Burkov 摘要了一项针对 LoRA 优化问题的新研究。标准 LoRA 把权重更新分解为降投影与升投影两个小矩阵,并将升投影初始化为零以保持基模型初始输出不变——这导致早期训练完全依赖随机初始化的降投影。论文作者证明这种设置会让各输入维度获得不均衡的「隐式学习率」,初始梯度范数偏弱,造成收敛慢与优化不稳定。研究提出对降投影矩阵做正则化,在保留 LoRA 参数高效微调核心优势的同时修正这些训练扭曲。对微调实践者值得关注的方法改进。

所属事件:新研究揭示 LoRA 优化缺陷:隐式低秩预条件子拖慢收敛(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →