NVIDIA 发文解析 Dense 与 MoE 架构选型权衡
NVIDIA 通过技术博客与开发者频道视频,系统讲解 Dense 与 MoE 两类架构在参数使用方式上的差异及其对部署的影响:Dense 模型每个 token 激活全部参数,而 MoE 模型仅激活部分专家参数。官方以 Nemotron 3.5 Lightning 为例——总参数 30B、每 token 仅激活 3B——说明 MoE 如何在推理效率与部署成本之间取得平衡,并给出了两类架构的选型与部署建议。
2026-09-16 ~ 2026-09-16 · 2 条相关
- NVIDIA 官方讲解:Dense 与 MoE 架构如何选,部署权衡全解析 — NVIDIA Developer · 2026-09-16
- NVIDIA 技术长文:30B MoE 模型为何每 token 只激活 3B 参数 — NVIDIAAI · 2026-09-16