英伟达更新 30B 混合架构模型,蒸馏使其智商飙升 70%

PavloMolchanov · x · 2026-08-11

英伟威达发布了 NVIDIA-Nemotron 系列中最小的 30B-A3B 模型(MoE+Mamba 架构)的权重更新。通过在连续预训练和后训练阶段从其更大的模型(Super 和 Ultra)中提取知识(蒸馏),该模型的能力得到了显著提升。

官方表示,其 AA 指数从 14 跃升至 24,实现了 70% 的性能增长,且无需更改任何底层架构。这意味着用户只需更新权重文件即可获得大幅智能提升,其表现已逼近比它大 4 倍的 Super 模型。该架构结合了 Mamba2 以高效处理长上下文,并利用 MoE 节省前向计算开销。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →