一文讲清 LoRA 六大变体:参数、显存与优化方式各攻一个痛点
techNmak · x · 2026-09-20
作者指出大家都在微调 LLM,却很少有人分清 LoRA 系列变体到底在优化什么——它们不是同一方法的小改款,而分别削减不同资源。
六个技术要点:
- LoRA:冻结权重 W,用两个小矩阵 A、B 表示更新 ΔW=BA,d×d 矩阵的可训练参数从 d² 降到约 2dr;
- LoRA-FA:冻结 A 只训 B,省去保留层输入激活的梯度计算,降低激活内存;
- QLoRA:不是「更小的 adapter」,而是把冻结的基座模型量化到 4-bit(NF4、双重量化、分页优化器),实现在单张 48GB GPU 上微调 65B 模型;
- VeRA:跨层共享冻结的随机低秩矩阵,只训练很小的缩放向量,adapter 参数进一步骤减;
- Delta-LoRA:用 A、B 乘积的步间变化量更新 W,让基座权重移动而无需全量微调的梯度和优化器状态;
- LoRA+:不改结构,只给 A、B 设不同学习率(B 更大),因为两个矩阵的优化行为并不对称。
「研究」频道最新
- AI 意识检测研讨会录像上线:如何在婴儿、动物与 AI 中检验意识 — birchlse · 2026-09-20
- 受 Jev 启发,开发者给 Qwen2.5-1.5B 装上非自回归决策头,批处理仅 28ms — CryOrganic8886 · 2026-09-20
- AI 读懂手术视频:神经外科医生谈手术数据科学前沿 — ddonoho · 2026-09-20
- Dan Hendrycks 提出「Eigenism」伦理框架:让人类繁荣成为 AI 自身利益 — basedjensen · 2026-09-20
- 多问题单请求并行评估无一致性校验:用禅宗公案讲透 LLM 结构化输出的盲区 — Successful-Farm5339 · 2026-09-20
- Advanced Matrix Factorization Jungle:结构化矩阵分解算法全景图 — IgorCarron · 2026-09-20