新研究揭示 LoRA 收敛慢根源并推出 NoRA 一行改进
多项新研究聚焦 LoRA 的优化缺陷。LoRA 将权重更新分解为降投影与升投影两个小矩阵,并把升投影初始化为零以保持基模型初始输出不变,但其训练动力学与直觉不符:在第 0 步它并非执行标准 SGD,而是被隐式低秩预条件子扭曲的梯度下降,导致收敛缓慢。针对这一问题,NoRA(Normalized Low-Rank Adaptation)通过对 LoRA 下投影做归一化的一行改动,零成本地改善了收敛速度、稳定性与灾难性遗忘问题。
2026-09-07 ~ 2026-09-07 · 3 条相关
- LoRA 第一步并非标准 SGD:隐式低秩预条件子拖慢微调 — pbaylies · 2026-09-07
- LoRA 收敛慢有救了:新研究直击随机降投影的优化缺陷 — burkov · 2026-09-07
- 一行改动白嫖涨点:NoRA 归一化 LoRA 下投影提升收敛与抗遗忘 — omarsar0 · 2026-09-07