单卡 GH200 跑 DeepSeek V4 Flash:DSpark 加速 2.7 倍实操指南
funding__secured · reddit · 2026-08-17
作者分享了在单张 NVIDIA GH200 上部署 DeepSeek-V4-Flash-0731 模型的完整方案。由于模型(284B MoE)无法完全放入 144GB HBM,作者利用 vLLM 的 UVA 功能将 88GB 专家权重卸载到 480GB LPDDR5x 内存中,并配合 DSpark 投机解码技术。
核心配置与成果:
- 使用 vLLM nightly 版本,无需打补丁即可原生支持 DSpark。
- 启用 cpu-offload-gb 88 和 offload-backend uva 处理显存不足。
- 性能数据:基线 64 tok/s → 启用 DSpark (k=5) 后提升至 171 tok/s(约 2.7 倍加速)。
避坑指南:
- 必须使用 nightly 版本,v0.26.0 不支持。
- 仅卸载专家权重,卸载 FP8 attention 权重会破坏 DeepGEMM。
- 无需使用选择性专家流式传输,NVLink C2C 速度足够快。
「Infra」频道最新
- LTX-2.5 对比 MiniMax H3:32GB 5090 上的 i2v 实测 — chanteuse_blondinett · 2026-08-17
- GitHub 宕机:网页及 API 错误率超 20% — jonathan_wilke · 2026-08-17
- 在经典机上为量子计算造 AI,如同用帆船技术设计喷气机 — AryHHAry · 2026-08-17
- 收购 OpenRouter,Stripe 布局机器支付基础设施 — 0xSammy · 2026-08-17
- PyTorchCon 北美站 10 月举行,推理专场聚焦低延迟服务 — PyTorch · 2026-08-17
- 调查:亚马逊为AI训练购书扫描后销毁,珍本遭毁 — james_mtc · 2026-08-17