Kimi K3 的 MoE 路由可能推高专家并行通信
stochasticchasm · x · 2026-07-28
Kimi K3 的 MoE 路由可能因为 top-k 16 承担更高通信成本
这条讨论聚焦于报告里的 Stable LatentMoE。核心思路是把完整模型宽度与被路由的专家宽度分离,使 Kimi K3 能把通道混合扩展到 896 个 routed experts,并且每个 token 使用 16 个 active experts。
发帖人认为,导致 expert parallel 通信开销偏高的原因可能有两个:一是 稀疏度很高,二是 top-k 16 相比 top-k 8 更容易把 token 路由到更多节点。配图还提到一个相当激进的 12 层 attnres 设计,推测与 pipeline parallelism 配置有关。
「模型」频道最新
- Kimi K3 已可在 Fireworks 上推理与训练 — omarsar0 · 2026-07-28
- 微软发布 MAI-Cyber-1-Flash,接管 MDASH 90% 安全任务 — mustafasuleyman · 2026-07-28
- MAI-Cyber-1-Flash 目标覆盖 CyberGym 90% 修补任务 — mustafasuleyman · 2026-07-28
- Gemini 视频生成会乱加词,还会拦截部分无害提示 — Individual-Cookie615 · 2026-07-28
- Polymarket 估算下月内发布新 Claude Sonnet 概率为 42% — Polymarket · 2026-07-28
- Kimi K3 论文披露 SiTU-GLU 与 896 专家 MoE 设计 — KyeGomezB · 2026-07-28