开发者实测 NVIDIA 版 Deepseek V4 NVFP4:1M 上下文下显存占用 96%
HankYeomans · x · 2026-09-05
一位开发者在 X 上分享了自己数小时内的实测过程:在 NVIDIA 提供的 Deepseek V4 NVFP4 量化版本上做参数摸索。目前跑出的配置为 1M token 上下文、显存占用 96%、batch size 2048,并附上了截图。作者表示还有更多配置待验证,但认为这是一次很有收获的学习过程。对于关注大模型 FP4 量化部署与极限上下文推理的人来说,是一份真实的性能边界参考。
「Infra」频道最新
- 别再无视那条 PyTorch 提示:一行设置真能省下大量 flops — generativist · 2026-09-06
- Qwen3.5 9B 手机端全本地跑通 Agent:推理、写码、生成 PDF 一条龙 — fuzhongkai · 2026-09-05
- AI Agent 落地生产后的失控难题:有人在造「Agent 版 SRE 控制层」 — Fantastic-Sleep-3352 · 2026-09-05
- 爆料称美前沿实验室堆 GPU 只为追最后 1-3% 模型性能 — SumitGup · 2026-09-05
- Arm CEO:没有计算问题离得开微处理器,CPU 不会死 — No Priors · 2026-09-05
- 端侧实时换脸开源项目:骁龙 NPU 跑通前置摄像头实时 FaceSwap — Few_Caregiver8134 · 2026-09-05