Marin 535B MoE 训练跑出 27% MFU,专家并行方案全复盘

dlwh · x · 2026-10-03

Marin 团队发布系列文章,复盘其 535B 参数 MoE hero run 如何在 11 台 NVL72 机架上跑到约 27% MFU,首篇由 ravwojdyla 讲专家并行(Expert Parallelism)。

关键事实:

技术路径: 团队尝试了 FSDP、现成 kernel 和自定义 kernel 等多种方案,每种都在 token 丢弃率、吞吐和模型容量之间权衡。作者坦诚披露了哪些尝试失败、最终上线的「不太优雅」方案,以及训练中途换入的更好方案。

选择 MoE 是因为在给定算力预算下获得更大模型容量:MoE 每 token 只激活部分专家权重,相同总算力下可训练更多 token。团队此前通过小规模实验和 scaling recipes(Quantile Balancing 实验,32B 总参/5B 激活、326B tokens)验证了 MoE 方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →