双机部署 304B 模型遇内存瓶颈,极限优化策略探讨
StartupTim · reddit · 2026-08-08
开发者探讨了在 2 台 NVIDIA DGX Spark(每台 128GB 统一内存)上部署 DeepSeek-V4-Flash-0731(304B MoE 模型)时,如何为操作系统释放更多内存空间。
部署现状与瓶颈
- 硬件与模型:双机共 256GB 统一内存,通过 ConnectX-7 直连。模型采用原生 FP8 权重(167GB),支持 100 万 token 上下文。
- 推理栈:基于源码编译的 vLLM,开启 TP=2 张量并行与投机采样(接受率约 80%)。
- 性能表现:单流解码速度达 82 tok/s,预处理约 1400 tok/s,14.6 万 token 长文测试 3/3 通过。
- 内存分配:模型权重与计算图占约 87-89GB,KV 缓存池约 11.2GB,剩余留给系统的空间仅 5-7GB(长文本任务时甚至会跌至 2-3GB)。
已排除的无效方案
- 降低 GPU 显存利用率或最大上下文长度:会导致 vLLM 拒绝启动或无法释放内存。
- 容器内存限制与开启 Swap:会导致页面回收循环或系统假死。
- CPU 卸载与磁盘缓存:在统一内存架构下无意义,或因数据格式不兼容而报错。
核心求助点
作者寻求在统一内存架构下,能有效降低 vLLM 宿主进程常驻开销的实际手段,特别是缩小 API server 与 worker 进程的 RSS,以及针对 ConnectX-7 网络的 NCCL 缓冲区调优。
「Infra」频道最新
- GPU SM数量对训练性能影响几何?Stas Bekman给出数值分析 — StasBekman · 2026-08-08
- OpenRelay 推统一推理端点:支持 8 种加速器,降本达 20% — ycombinator · 2026-08-08
- 曝马斯克SpaceX 2027年将建10GW算力,占Nvidia Rubin产量三成 — zephyr_z9 · 2026-08-08
- 开发云环境竟比 EC2 还贵?开发者吐槽为易用性付溢价 — Pavel_Asparagus · 2026-08-08
- 单卡 RTX 5090 能否跑得动 MiniMax-H3? — StartupTim · 2026-08-08
- Together AI 深度解析:如何为突发性 LLM 推理做自动扩缩容 — zainhas · 2026-08-08