Marin 535B MoE 训练跑出 27% MFU,专家并行方案全复盘
dlwh · x · 2026-10-03
Marin 团队发布系列文章,复盘其 535B 参数 MoE hero run 如何在 11 台 NVL72 机架上跑到约 27% MFU,首篇由 ravwojdyla 讲专家并行(Expert Parallelism)。
关键事实:
- 模型原计划 360B,EP 让总参数扩大约 50% 到 535B,每 token 激活约 23B 参数
- hero run 使用自研 fixed-capacity EP kernel,MFU 21.5%,token-expert 分配丢弃率 3.4%
- 535B 模型在 BF16/FP32 混合精度 + Adam 下状态占用近 8 TiB
技术路径: 团队尝试了 FSDP、现成 kernel 和自定义 kernel 等多种方案,每种都在 token 丢弃率、吞吐和模型容量之间权衡。作者坦诚披露了哪些尝试失败、最终上线的「不太优雅」方案,以及训练中途换入的更好方案。
选择 MoE 是因为在给定算力预算下获得更大模型容量:MoE 每 token 只激活部分专家权重,相同总算力下可训练更多 token。团队此前通过小规模实验和 scaling recipes(Quantile Balancing 实验,32B 总参/5B 激活、326B tokens)验证了 MoE 方案。
「Infra」频道最新
- mamf-finder 升级:支持 FP8/MXFP4/NVFP4 实测 GPU 真实 TFLOPS — StasBekman · 2026-10-03
- 实测 B200:nvfp4 比 mxfp4 省 9% 算力且精度更高,Blackwell 起建议选前者 — StasBekman · 2026-10-03
- LithosAI 发布 LithosBox:毫秒级快照分叉的 Agent 沙箱 — JiaZhihao · 2026-10-03
- 传 RTX Spark 笔记本 10 月 7 日发布,24GB-128GB 售 1800-2900 美元 — Porespellar · 2026-10-03
- 呼吁 Qwen4 27B 搭载可卸载到内存的 100B+ Engram — casper_hansen_ · 2026-10-03
- Hugging Face 发布 State of Local AI 2026:单卡游戏 GPU 已达年初顶级水平 — Scobleizer · 2026-10-03