单台 DGX Spark 跑满 DeepSeek V4 Flash 155G:2-bit 量化与 MTP 提速实测
Puzzleheaded_Base302 · reddit · 2026-08-03
作者分享了在单台 DGX Spark (GB10, 121.7 GiB 统一内存) 上,使用 vLLM-Moet 2-bit 量化本地运行 155 GB 的 DeepSeek-V4-Flash-0731 的完整踩坑记录与性能实测。
核心性能数据:
- Prefill 速度稳定在 1000 t/s。
- 开启 MTP (Multi-Token Prediction) 后,Decode 速度从 19 tok/s 提升至 25.2 tok/s(并发 1 时提升 31.5%),但在高并发(并发 4)时总吞吐量会有 5.3% 的轻微下降。
关键部署障碍与解决:
- 必须原生编译:Docker 镜像无法跨架构(x86 到 ARM64)传输,必须在 Spark 上原生构建。
- 修改 Dockerfile:默认的 digest 仅支持 amd64,需替换为多架构 tag。
- 硬件适配:需引导 AI 修改代码以绕过不支持的 sm121 GPU 报错,并设置超大 swapfile 防止模型加载失败。
- 超时处理:由于加载时间极长,需增大 vLLM 的默认超时限制。
「Infra」频道最新
- 30B视频MoE模型量化版实测:多数人暂不建议折腾 — EntireBig7258 · 2026-08-03
- AI数据中心年耗水量可达15亿加仑 — AndyMasley · 2026-08-03
- 备战本地大模型推理:极客组装 30TB SSD 与 256GB 内存 — reto-wyss · 2026-08-03
- 分析师预计CPO封装技术2028年前难实现大批量出货 — BenBajarin · 2026-08-03
- DeepSeek V4 Flash 预填充提速方案:降级 CUDA 至 13.1 — fragment_me · 2026-08-03
- 康奈尔大学发布并行计算与高性能计算学习路线图 — thehiphopswami · 2026-08-03