成功微调350亿参数MoE:探究模型内部的路由机制

VectorInst · x · 2026-07-30

Vector团队分享了成功在4张A100上微调350亿参数多模态MoE的方案:保持MoE层完整不分片,并叠加3项优化——4-bit量化、Flash Attention 2,以及使用forward hook将logit显存占用从23.3GB降至0.3GB。

成功运行后,团队审计了模型的路由学习机制:1-28层主要根据模态(音频、视频、文本)进行稳定路由;29-48层则转向基于语义内容进行路由。文本Token最为动态,深层网络中活跃的专家数量大幅减少,表明模型从感知编码转向了高级推理。

所属事件:Vector Institute 分享 350 亿参数 MoE 微调实践(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →