LoRA 第一步并非标准 SGD:隐式低秩预条件子拖慢微调
pbaylies · x · 2026-09-07
作者指出 LoRA 的训练动力学与直觉不符:它并不对权重执行标准 SGD。
- 在第 0 步,LoRA 实际执行的是被一个隐式低秩预条件子扭曲的梯度下降,该预条件子为 P = alpha^2 · A^T A。
- 这个随机构建的瓶颈会悄悄压制微调早期的梯度更新,拖慢收敛。
- 作者以线程形式展开分析(原帖为推文串开头),核心论点是理解 LoRA 需要考虑这一预条件结构,而非简单当作权重上的低秩 SGD。
「研究」频道最新
- MUCG 多模态统一理解与生成研讨会将亮相 ECCV 2026 — jmin__cho · 2026-09-07
- 雷达点云分类:点密度才是瓶颈,F1 从 0.381 翻倍至 0.764 — bruno_pinto90 · 2026-09-07
- AI 数学播客对话 CMU 教授 Avigad:数学能否被自动化 — EchoShao8899 · 2026-09-07
- 「The honest claim」成预印本高频词,暴露AI代写痕迹 — lpachter · 2026-09-07
- ML 研究可复现性正走向失效:三大诱因讨论引热议 — NeighborhoodFatCat · 2026-09-07
- GPT Astra 三试其一解决 1962 年 Erdős–Sós 猜想,仅花 363 美元 — burny_tech · 2026-09-07