硬核探讨:跨设备异构组网下 vLLM 与 Ray 的混合部署

jwhh91 · reddit · 2026-07-26

用户探讨了在复杂的异构硬件环境下使用 vLLM 和 Ray 部署大模型的实践。硬件环境包括两台 DGX Sparks 和一台搭载 RTX 5090 的 x64 主机,通过 ConnectX-7 网卡互联。

核心诉求是:针对一个 300B(150GB)的 MoE 模型,希望在 DGX 上保持 TP=2 的同时,将注意力头和热门专家路由到 5090 的 GDDR7 显存上。作者询问如何通过增强或补充 vLLM 中的 Ray 来实现这种计算偏移。此外,作者分享了使用 ConnectX-7 配合 NVME RAID1 加载模型权重的经验,速度可达 20 Gb/s,认为这解决了可维护的模型服务问题。

所属事件:vLLM与Ray异构组网部署大模型实践(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →