UltraEP 把 MoE 实时均衡带进小红书机架级推理栈
机器之心 · wechat · 2026-07-29
这篇长文介绍了小红书 dotsinfra 团队的 UltraEP:一个面向 MoE 的实时负载均衡运行时。
它解决什么问题
- 在机架级 MoE 训推中,专家负载会随 token 路由剧烈波动。
- 如果只按历史统计做均衡,热点专家仍会拥堵,真实吞吐会明显低于理想值。
UltraEP 怎么做
- 在 Gate 之后、token dispatch 之前,直接读取当前 microbatch 的真实负载。
- 联合求解“复制哪些专家”与“token 该路由到哪里”。
- 通过预留冗余 slot 放置临时副本,避免频繁申请/释放显存。
- 前后向复用复制方案,并在 MoE 层之间共享冗余 buffer,控制显存开销。
主要结果
- 前向关键路径额外开销约 300 微秒。
- 在 Qwen3-235B-A22B 上,总关键路径开销也基本控制在这一量级。
- 在 106B–671B 的主流 MoE 上,动态负载下吞吐达到理想均衡性能的 94.3%。
- 相比 Megatron-LM / SGLang,平均吞吐提升 1.49 倍。
- 最忙的 rank 负载从最高 4.01 倍 压到 1.04 倍。
结论
作者把 UltraEP 定位成 MoE 基础设施栈里的一个独立运行时:它补的是“路由结果已经产生之后,系统如何立刻把专家资源调平”这一层能力。
「Infra」频道最新
- SK hynix 据称与约 10 家大客户签长期合同 — dejavucoder · 2026-07-29
- 上海 Aishengna 被指接手 DUV 光刻设备制造 — zephyr_z9 · 2026-07-29
- 跨厂商 Vulkan 后端把端侧推理从 30ms 压到 3ms — ppchaos · 2026-07-29
- pdf-mcp 把技术 PDF 转成结构化文本和可搜索图像 — tom_doerr · 2026-07-29
- Moonshot 发布 2.8T 开源 Kimi K3,支持 100 万 token 上下文 — alex_verem · 2026-07-29
- 新 scaling law 发现:部分规模下重复训练胜过改写 — burny_tech · 2026-07-29