新研究揭示 LoRA 收敛慢根源并推出 NoRA 一行改进

多项新研究聚焦 LoRA 的优化缺陷。LoRA 将权重更新分解为降投影与升投影两个小矩阵,并把升投影初始化为零以保持基模型初始输出不变,但其训练动力学与直觉不符:在第 0 步它并非执行标准 SGD,而是被隐式低秩预条件子扭曲的梯度下降,导致收敛缓慢。针对这一问题,NoRA(Normalized Low-Rank Adaptation)通过对 LoRA 下投影做归一化的一行改动,零成本地改善了收敛速度、稳定性与灾难性遗忘问题。

2026-09-07 ~ 2026-09-07 · 3 条相关