LoRA 分层消融实测:代码靠 MLP,推理靠注意力
Even_Package_8573 · reddit · 2026-09-08
作者针对 Thinking Machines 写作中一笔带过的「分层应用 LoRA」问题,做了带控制的消融实验:固定种子、留出验证集,每次冻结一组层,MoE 模型中冻结专家权重、保持 router 可训练,分别在 GLM-5.3(代码任务)和 Llama(多步推理)上测试。
结论:
- 全层训练仍是最优默认,但各层贡献极不均衡,且哪些层重要取决于任务;
- 代码任务:MLP 块承担了绝大部分收益——冻结注意力、只训 MLP 已接近全层基线;反之只训注意力则崩掉;
- 推理任务:正好反转,冻结注意力会崩溃,只训 MLP 可用但多步推理明显变差。
作者还在多卡笔记本上并行跑消融组,避免单卡排队三周。实践建议:默认全层开着;若某次微调「语气对但行为不对」或参数预算紧张,跑两次实验即可定位对任务关键的是哪一组层。
「研究」频道最新
- 可解释 AI 揭示机翼湍流中被经典理论忽略的流动结构 — ricardovinuesa · 2026-09-08
- SolarWM 视频世界模型数据集登上 Hugging Face 热门 — junchaoh-cs · 2026-09-08
- MIT 教授 Isola:云上 LLM 或将远程操纵机器人 — Justgototheeffinmoon · 2026-09-08
- Lightwheel 开源 10 万小时第一视角数据,机器人数据荒有望终结 — chris_j_paxton · 2026-09-08
- 扩散模型早期样本被拉向数据集中心:一个反直觉的几何性质 — alec_helbling · 2026-09-08
- Diffusion Explorer:交互式可视化扩散与流匹配模型几何直觉的开源工具 — alec_helbling · 2026-09-08