Kimi K3 用分位数路由平衡 MoE 专家负载
stochasticchasm · x · 2026-07-28
这条帖在讨论 Kimi K3 的 Quantile Balancing(QB)路由更新。
- 作者认为这个 scale-up 值得欢迎,并指出它延续了 DeepSeek 式的归一化思路,而不是直接拿带偏置的分数做加权。
- 他们也喜欢 QB 的因果设计:用 上一批 token 来估计当前批次的阈值。
- 配图来自 Kimi K3 技术报告,核心思路是:
- 不再只做标准 Top-k,而是先在带偏置分数上做 Top-(k+1)
- 多出来的那个位置作为 cutoff 阈值
- 再根据 token 分数边际的 分位数 来设定每个 expert 的 bias
- 目标是改善大规模 MoE 路由的负载均衡,尤其是在 expert 数量继续变大时。
所属事件:Kimi K3技术报告详解MoE架构与SiTU-GLU设计(4 条相关)→
「模型」频道最新
- Moonshot 公开 2.8T 前沿模型权重并放出运行基础设施 — 0xSammy · 2026-07-28
- Kimi K3 报告称缩放效率比 K2 提升 2.5 倍 — ricklamers · 2026-07-28
- The Verge 认为 Kimi K3 可能冲击美国闭源模型 — The Verge AI · 2026-07-28
- Moonshot 发布 Kimi K3:2.8T MoE、1M 上下文和 2.5 倍效率提升 — joeddav · 2026-07-28
- Kimi K3 已可在 Fireworks 上推理与训练 — omarsar0 · 2026-07-28
- Gemini 视频生成会乱加词,还会拦截部分无害提示 — Individual-Cookie615 · 2026-07-28