Kimi K3 的 MoE 路由可能推高专家并行通信

stochasticchasm · x · 2026-07-28

Kimi K3 的 MoE 路由可能因为 top-k 16 承担更高通信成本

这条讨论聚焦于报告里的 Stable LatentMoE。核心思路是把完整模型宽度与被路由的专家宽度分离,使 Kimi K3 能把通道混合扩展到 896 个 routed experts,并且每个 token 使用 16 个 active experts。

发帖人认为,导致 expert parallel 通信开销偏高的原因可能有两个:一是 稀疏度很高,二是 top-k 16 相比 top-k 8 更容易把 token 路由到更多节点。配图还提到一个相当激进的 12 层 attnres 设计,推测与 pipeline parallelism 配置有关。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →