LatentMoE 如何重塑 MoE 范式

青稞AI · wechat · 2026-07-19

这篇文章用 Kimi K3 和 NVIDIA Nemotron3 Super 两个案例,解释了 LatentMoE(潜在 MoE) 为什么可能成为下一代 MoE 的关键范式。

核心论点是:传统 MoE 的瓶颈不只在专家数量,而在于 token 路由到 expert 时,必须读取大维度权重并进行 all-to-all 通信,随着模型变大,这两项开销会线性恶化。LatentMoE 的做法是先把 token 从原始维度 d 投影到更小的潜在空间 ℓ,在低维空间里做路由和 expert 计算,再投影回去,从而:

文中给出两个实践案例:

作者还总结了两条路线的区别:NVIDIA 更偏“效率优先”,Kimi 更偏“极致规模”,但本质上都在用压缩 expert 计算维度的方式,把节省下来的资源换成更大的专家组合能力。最后文章还展望了几个方向:自适应压缩比、动态 Top-K 路由,以及把结构化稀疏性纳入架构设计。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →