Kimi K3 在新 MoE 设计中三倍参数、双倍激活专家

teortaxesTex · x · 2026-07-27

这张图给出了 Kimi K3 相比 K2 的一组关键架构变化:

帖文的核心判断是:K3 的 latent bottleneck 不是为了减少路由流量,而是把省下来的宽度重新用在更多激活专家上;因此它的每 token expert dispatch 量与 K2 基本保持不变。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →