Kimi K3 预训练混合多种并行,MoonEP 主打负载均衡

SeunghyunSEO7 · x · 2026-07-28

Kimi K3 预训练采用多种并行与 MoE 基础设施

配图展示了 Kimi K3 技术报告中的训练系统设计:其 3T 级预训练结合了 Pipeline Parallelism(含虚拟 stage)、Expert Parallelism、ZeRO-1 数据并行、Pipeline ZeRO-2 梯度共享 和 Context Parallelism。

截图里的 MoonEP 章节重点在于解决 MoE 训练中的负载不均:

核心结论是:这套方案试图在保持 MoE 训练主流程不变的前提下,把负载均衡和通信效率同时做得更适合大规模预训练。

所属事件:Kimi K3 技术报告解读:2.8T MoE 与架构效率突破(49 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →