M2 Max 上跑通 Nemotron 75B
These_Meaning_3883 · reddit · 2026-07-12
作者把 Nemotron Puzzle 75B 跑在 64GB M2 Max 上,并为 mlx-lm 增加了原生 nemotronhpuzzle 支持。
实测结果
在相同提示、5 个随机种子、temp 1.0 / topp 0.95 下,对比 4-bit 与 5-bit expert 量化:
- 4-bit experts:checkpoint 42.03 GiB,峰值 49.68 GB,平均 14.27 tok/s,任务通过 24/30
- 5-bit experts:checkpoint 49.88 GiB,峰值 58.12 GB,平均 10.53 tok/s,任务通过 21/30
- 长上下文检索:4-bit 为 4/5,5-bit 为 0/5
关键结论
- 作者怀疑 5-bit 在 64GB 机器上贴着内存上限运行,KV cache 和工作集增长导致性能和稳定性变差
- 在 96GB/128GB 机器上,5-bit 结果可能不同
适配过程中的技术细节
- 为 Nemotron-H 增加了 blockwise config、tensor remapping,并匹配 NVIDIA 的 FP32 norm/router 行为
- 遇到第一层 SSM 输出与参考实现 cosine similarity 只有 0.8832 的问题
- 根因是 NVIDIA 在 BF16 中先算 softplus(dt + dtbias),再转 FP32;mlx-lm 的共享路径是先转 FP32,修正后相似度提升到 0.999998
- BF16 输出头是必须的:131k 词表的 lmhead 若量化到 4-bit 会产生重复垃圾输出
「Infra」频道最新
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11
- p99 延迟基准可能在骗你:一篇长文讲透 coordinated omission — Franc0Fernand0 · 2026-09-11