Kimi K3 的稀疏 MoE 细节
techNmak · x · 2026-07-19
这条长帖解释了 Kimi K3 的稀疏 MoE 设计:它有 2.8 万亿参数,但在一次稀疏专家计算中,实际只会激活 896 个专家里的 16 个,其余大部分专家不参与当次计算。
作者指出,问题不只是“模型有多少专家”,更关键的是 路由与负载均衡:如果少数专家被过度分配,吞吐会被拖垮。Moonshot 给出的方案是 Quantile Balancing,用路由分数的分位数直接做分配,避免反复启发式修正和一个敏感的平衡超参。另一方面,他们还做了 完全平衡的 expert-parallel 训练,使用静态 shape、critical path 上不需要 host 同步,目标是防止专家不均衡进一步破坏分布式训练吞吐。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11