NVIDIA 技术长文:30B MoE 模型为何每 token 只激活 3B 参数
NVIDIAAI · x · 2026-09-16
NVIDIA 发布技术博客,以 Nemotron 3.5 Lightning(30B 总参数、每 token 仅激活 3B)为例,系统讲解 Dense 与 MoE 架构的差异与选型:
- 参数解耦:MoE 将显存成本与计算成本解耦——所有专家常驻 VRAM,但每个 token 只激活子集;Dense 模型两者同步增长
- 吞吐:同等总参数下,MoE(如 Nemotron 3.5 Lightning)token 吞吐高于 Dense(如 Gemma 4 31B),但高并发时延迟优势收窄
- 微调与量化:MoE 需注意路由器失衡;量化对 router 与 recurrent-projection 层的影响与 Dense 组件不同
- 选型建议:应基于显存预算、并发需求、微调计划与量化行为决定,而非只看参数量
文中附模型在 build.nvidia.com、Hugging Face 与 OpenRouter 的获取方式。
所属事件:NVIDIA 发文解析 Dense 与 MoE 架构选型权衡(2 条相关)→
「Infra」频道最新
- SentencePiece Lite 发布:50KB 二进制,tokenization 快 20-30 倍 — heiga_zen · 2026-09-16
- 华为内部万字备忘录泄露:押注昇腾950替代英伟达,不做基础模型 — pstAsiatech · 2026-09-16
- Qwen 27B 与 DeepSeek v4 Flash 同机异构运行,展示 GPU+统一内存方案 — samsja19 · 2026-09-16
- JPMorgan 预测 2028 年 GPU/ASIC 出货超 2500 万,ASIC 主导增长 — bookwormengr · 2026-09-16
- iamtrask:终局不是单个 AGI,而是人人运行小型 LLM 的信任网络 — iamtrask · 2026-09-16
- Program-as-Weights:0.6B 模型跑赢 32B 直接提示,内存仅 1/50 — yuntiandeng · 2026-09-16