NVIDIA 75B 混合 MoE 本地可跑:Mamba+注意力交错,参数量砍至 9.3B 激活
jacek2023 · reddit · 2026-09-03
- 模型:NVIDIA Nemotron-3-Puzzle-75B-A9B 已可经 llama.cpp 在本地运行。
- 架构:混合 MoE,Mamba、MoE 与注意力层交错排列;支持 Multi-Token Prediction(MTP)加速文本生成。
- 规格:相比母模型 Nemotron-3-Super-120B-A12B(总参数 120.7B / 激活 12.8B),压缩到总参数 75.3B / 激活 9.3B。
- 意义:75B 混合 MoE 是个值得关注的本地部署甜点尺寸,想试 Nemotron-3-Super 但机器不够的用户可以选它;也可对比更新的 Nemotron-3.5-Lightning-30B-A3B。
「Infra」频道最新
- 开发者吐槽 PyTorch MPS 线性代数:不仅慢还批处理不完整 — ducha_aiki · 2026-09-03
- Anthropic 与 Lambda 签 350 亿美元云算力大单扩容 Claude — The Decoder · 2026-09-03
- Hot Chips 2026 斯坦福大会全解析:GPU、内存与定制加速器 — AccBalanced · 2026-09-03
- Neocloud 的护城河是融资:先锁电力,再锁客户,最后融资买卡 — AccBalanced · 2026-09-03
- 一个 20 年老漏洞让研究员摸进数万个数据中心裸机管理口 — AccBalanced · 2026-09-03
- Oxide RFD 26 披露机柜主机操作系统与 Hypervisor 技术选型细节 — Sethwinterroth · 2026-09-03