LoRA 分层消融实测:代码靠 MLP,推理靠注意力

Even_Package_8573 · reddit · 2026-09-08

作者针对 Thinking Machines 写作中一笔带过的「分层应用 LoRA」问题,做了带控制的消融实验:固定种子、留出验证集,每次冻结一组层,MoE 模型中冻结专家权重、保持 router 可训练,分别在 GLM-5.3(代码任务)和 Llama(多步推理)上测试。

结论:

作者还在多卡笔记本上并行跑消融组,避免单卡排队三周。实践建议:默认全层开着;若某次微调「语气对但行为不对」或参数预算紧张,跑两次实验即可定位对任务关键的是哪一组层。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →