成功微调350亿参数MoE:探究模型内部的路由机制
VectorInst · x · 2026-07-30
Vector团队分享了成功在4张A100上微调350亿参数多模态MoE的方案:保持MoE层完整不分片,并叠加3项优化——4-bit量化、Flash Attention 2,以及使用forward hook将logit显存占用从23.3GB降至0.3GB。
成功运行后,团队审计了模型的路由学习机制:1-28层主要根据模态(音频、视频、文本)进行稳定路由;29-48层则转向基于语义内容进行路由。文本Token最为动态,深层网络中活跃的专家数量大幅减少,表明模型从感知编码转向了高级推理。
所属事件:Vector Institute 分享 350 亿参数 MoE 微调实践(3 条相关)→
「研究」频道最新
- 算力狂飙:2028 年 AI 将解锁的十大科技突破 — Annual_Judge_7272 · 2026-07-30
- 实现 SOTA 深度研究:训练模型而非仅靠脚手架 — SimonShaoleiDu · 2026-07-30
- 普林斯顿教授评 MIT 非凸优化新论文:未达悬赏要求 — HazanPrinceton · 2026-07-30
- 开发者打造开源 4-DOF 机器人 OpenDerm,居家全自动排查皮肤癌 — plopesresearch · 2026-07-30
- 深度学习研究课程更新:深入解析多类 Softmax 损失函数 — alfcnz · 2026-07-30
- Scale AI 纽约 meetup:探讨编程智能体基准测试新进展 — jyangballin · 2026-07-30