MoonEP 用动态冗余专家让 MoE 训练保持平衡
stochasticchasm · x · 2026-07-28
这条贴的是 MoonEP 论文中关于 MoE 专家并行训练 的一段,重点解决负载不均和内存碎片问题。
- 传统 expert-parallel 方案里,各个 rank 的 token 负载常常不均衡,会拖慢吞吐,还会因为 routed-expert activation 的形状动态变化而产生明显内存碎片。
- MoonEP 的思路是在保留传统 EP 总体计算流程的前提下,引入 冗余专家的在线规划与迁移。
- 前向阶段会根据当前 micro-batch 和 layer 的 router 输出,先规划冗余专家并预取,再执行 routed-expert 计算。
- 反向阶段先把梯度放进本地 reduce buffer,计算结束后再回收到各自 home rank 的梯度缓冲区。
- 论文还给出一个平衡性结论:每个 rank 需要收到恰好 S × K 个 token,并证明在每个 rank 最多放 E / R 个冗余专家时,始终能找到可行平衡方案。
- 作者对比了 ECHO、UltraEP 等方法,指出它们要么预设冗余专家数量,要么限制每个 rank 的 token 上限,仍可能留下残余不平衡,甚至在找不到可行方案时迫使训练中断。
「Infra」频道最新
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28
- Kimi K3 在 Together AI 上线,首日就给出数亿级 TPM 容量 — togethercompute · 2026-07-28
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计 — stochasticchasm · 2026-07-28
- vLLM 推出 Kimi K3 部署指南,适配 2.8T MoE 和百万上下文 — AccBalanced · 2026-07-28
- SkyPilot 称,部署 Kimi K3 需要多节点推理和完整服务栈 — skypilot_org · 2026-07-28