英伟达开源75B参数MoE模型Puzzle
英伟达最新开源了面向部署优化的混合专家模型Nemotron-Labs-3-Puzzle-75B-A9B。该模型由Nemotron-3-Super-120B通过Iterative Puzzle框架压缩蒸馏而来,总参数75.3B,激活参数仅9.3B,并支持百万token上下文。这种深度压缩在保持模型质量的同时,使交互式服务吞吐量近乎翻倍。
2026-07-07 ~ 2026-07-08 · 4 条相关
- 英伟达发布压缩优化模型 Nemotron Puzzle-75B — jacek2023 · 2026-07-07
- NVIDIA压缩论文:MoE模型交互吞吐近翻倍 — omarsar0 · 2026-07-08
- 开源模型 Nemotron-Labs-3-Puzzle-75B 发布 — victormustar · 2026-07-08
- NVIDIA开源75B MoE模型,支持百万token上下文 — AIFlow_ML · 2026-07-08