Kimi K3 预训练混合多种并行,MoonEP 主打负载均衡
SeunghyunSEO7 · x · 2026-07-28
Kimi K3 预训练采用多种并行与 MoE 基础设施
配图展示了 Kimi K3 技术报告中的训练系统设计:其 3T 级预训练结合了 Pipeline Parallelism(含虚拟 stage)、Expert Parallelism、ZeRO-1 数据并行、Pipeline ZeRO-2 梯度共享 和 Context Parallelism。
截图里的 MoonEP 章节重点在于解决 MoE 训练中的负载不均:
- 传统 EP 容易出现各 rank token 数不平衡。
- MoonEP 通过 动态冗余专家 实现“完全平衡”的专家并行训练。
- 它会根据 router 输出在线规划少量冗余专家,提前预取到位,再在反向传播中把梯度回传到原始 rank。
- 文档还强调了 在线规划、零拷贝通信 和 静态 shape,目标是在大规模训练下尽量压低开销。
核心结论是:这套方案试图在保持 MoE 训练主流程不变的前提下,把负载均衡和通信效率同时做得更适合大规模预训练。
所属事件:Kimi K3 技术报告解读:2.8T MoE 与架构效率突破(49 条相关)→
「Infra」频道最新
- POCKET 项目:让 350 亿参数大模型在 iPhone 上运行 — pmttyji · 2026-07-28
- Diffusers 原生接入 Nunchaku 4 比特扩散推理 — dl_weekly · 2026-07-28
- SK hynix 称 AI 需求“难以置信”,存储热潮仍在延续 — firstadopter · 2026-07-28
- OpenAI agent 演示、开源权重潮与 AI 碳成本重塑企业判断 — jonerp · 2026-07-28
- Verizon 签下超 10 亿美元谷歌暗光纤协议,转建 AI 微型数据中心 — The Decoder · 2026-07-28
- Verizon与Google签10亿美元暗光纤协议,改造机房为AI数据中心 — Ars Technica AI · 2026-07-28