MoE 训练论文提出感知负载的 expert-GEMM 调度
stochasticchasm · x · 2026-07-28
这条贴的是一段关于 expert-GEMM 调度与重叠 的论文截图,核心是在 MoE 训练里减少负载不均带来的效率损失。
- 即使各个 rank 的总体负载看起来平衡,单个 rank 内的 token 分布仍然可能很偏,导致不同 SM 之间的完成时间不一致。
- 作者提出一种 感知负载的调度器:在 launch 之前根据当前 token 分布调整参数,并在执行过程中保持固定。
- 这个调度器用轻量启发式方法,结合硬件指标的解析成本模型,参数通过离线 autotuning 校准。
- 对于 shared experts,则把 GEMM 分发到独立 stream,与其他 kernel 重叠执行。
「Infra」频道最新
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28
- Kimi K3 在 Together AI 上线,首日就给出数亿级 TPM 容量 — togethercompute · 2026-07-28
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计 — stochasticchasm · 2026-07-28
- vLLM 推出 Kimi K3 部署指南,适配 2.8T MoE 和百万上下文 — AccBalanced · 2026-07-28
- SkyPilot 称,部署 Kimi K3 需要多节点推理和完整服务栈 — skypilot_org · 2026-07-28