通过 ShimQuant 修补,Nemotron 16GB 显存运行成真
Daxfortuna · reddit · 2026-08-30
作者开发了 ShimQuant 技术来量化 Nemotron-3.5-Lightning 模型。由于该模型张量宽度非 256 倍数,传统量化工具无法有效压缩(仅能到 4.7 bpw)。作者通过在量化时填充并在推理时切片,实现了 3.07 bpw(11.77 GiB)的体积,使其能在 16GB 显存显卡上运行。该方案在 HumanEval 上得分 91.5%,与 19.65 GB 版本持平,但需要打补丁的 llama.cpp 支持。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01