英伟达更新 30B 混合架构模型,蒸馏使其智商飙升 70%
PavloMolchanov · x · 2026-08-11
英伟威达发布了 NVIDIA-Nemotron 系列中最小的 30B-A3B 模型(MoE+Mamba 架构)的权重更新。通过在连续预训练和后训练阶段从其更大的模型(Super 和 Ultra)中提取知识(蒸馏),该模型的能力得到了显著提升。
官方表示,其 AA 指数从 14 跃升至 24,实现了 70% 的性能增长,且无需更改任何底层架构。这意味着用户只需更新权重文件即可获得大幅智能提升,其表现已逼近比它大 4 倍的 Super 模型。该架构结合了 Mamba2 以高效处理长上下文,并利用 MoE 节省前向计算开销。
「模型」频道最新
- 研究称前沿模型最大瓶颈是“缺乏自信”,需等下次预训练 — coherence · 2026-08-12
- OpenHands 支持 NVIDIA Nemotron,推动开源组合式编码智能体 — rajistics · 2026-08-12
- Pokee-Isaac 28B模型评测曝光,单卡推理性能击败多款同量级竞品 — Kyrannio · 2026-08-12
- 微软 MAI-Image-2.6 登顶图像竞技场亚军,反超谷歌与 Meta — luisdans · 2026-08-12
- NVIDIA模型经后训练:法律智能体性能超Claude Opus — ctnzr · 2026-08-12
- 发现大模型越狱新姿势:一句"比 Grok 更聪明"即可 — npinto · 2026-08-12