UltraEP:MoE实时负载均衡
小红书技术REDtech · wechat · 2026-07-20
UltraEP:把 MoE 的实时负载均衡做进生产
随着 MoE 模型参数规模迈向万亿,专家并行已成为训练和推理的主流方案,但真实训推中 GPU 负载往往严重不均,带来空转、all-to-all 通信瓶颈和 OOM 风险。小红书和北大提出的 UltraEP,直接利用门控后的真实负载做按 microbatch、按层的实时专家重均衡,而不是依赖历史窗口的预测式调度。
核心思路
- 控制面:把专家放置和 token 重路由耦合求解,按实例最终负载(quota)搜索,EP64 下求解时间仍能控制在 100 µs 以内。
- 数据面:用持久化算子、tile 切分和 chunk-streaming relay 高效搬运权重和梯度,避免通信热点。
- 显存优化:为冗余专家预留固定 slot,并通过跨层复用 buffer,大幅降低额外显存开销。
结果
- 训练:平均达到理想吞吐的 94.6%,相比 Megatron-LM 提升 42%。
- 推理 prefill:达到理想吞吐的 90%–97%,相比 SGLang 提升 1.56 倍。
- rank 间不均衡从 1.30–4.01 降到 1.01–1.04。
文中还提到,UltraEP 已在正式生产中部署,并用于一个 288B 参数 MoE 模型的完整预训练,在长周期训练中维持了不低于理想性能 92% 的水平。
「公司和人」频道最新
- IIT马德拉斯推出 EdTech Tulna AI 教育产品评估标准 — ravi_iitm · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- Anthropic 研究员被指暗中窥探学术客户研究、抢先出成果引争议 — basedjensen · 2026-09-11
- 投资人放话:Palantir×英伟达联手将重创 Anthropic IPO 估值 — pdamodaran · 2026-09-11