双机部署 304B 模型遇内存瓶颈,极限优化策略探讨

StartupTim · reddit · 2026-08-08

开发者探讨了在 2 台 NVIDIA DGX Spark(每台 128GB 统一内存)上部署 DeepSeek-V4-Flash-0731(304B MoE 模型)时,如何为操作系统释放更多内存空间。

部署现状与瓶颈

已排除的无效方案

核心求助点

作者寻求在统一内存架构下,能有效降低 vLLM 宿主进程常驻开销的实际手段,特别是缩小 API server 与 worker 进程的 RSS,以及针对 ConnectX-7 网络的 NCCL 缓冲区调优。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →