硬核探讨:跨设备异构组网下 vLLM 与 Ray 的混合部署
jwhh91 · reddit · 2026-07-26
用户探讨了在复杂的异构硬件环境下使用 vLLM 和 Ray 部署大模型的实践。硬件环境包括两台 DGX Sparks 和一台搭载 RTX 5090 的 x64 主机,通过 ConnectX-7 网卡互联。
核心诉求是:针对一个 300B(150GB)的 MoE 模型,希望在 DGX 上保持 TP=2 的同时,将注意力头和热门专家路由到 5090 的 GDDR7 显存上。作者询问如何通过增强或补充 vLLM 中的 Ray 来实现这种计算偏移。此外,作者分享了使用 ConnectX-7 配合 NVME RAID1 加载模型权重的经验,速度可达 20 Gb/s,认为这解决了可维护的模型服务问题。
所属事件:vLLM与Ray异构组网部署大模型实践(2 条相关)→
「Infra」频道最新
- LLM 配置调优讨论:80K 上下文下 KV cache 取舍 — kingo86 · 2026-07-26
- SK Hynix 直言 HBM 不是 AI 内存墙的终局方案 — rwang07 · 2026-07-26
- vLLM 社区再拉联盟,Inferact 加入开源生态公开信 — vllm_project · 2026-07-26
- Reddit 用户纠结 3000 美元 M1 Ultra 128GB 与 M2 Ultra 64GB — jaqueh · 2026-07-26
- MCP 成功不等于正确,谁来验证工具副作用成了问题 — marcin_michalak · 2026-07-26
- vLLM 和 Ray 能否把热专家挪到 RTX 5090 上 — 2thleZ · 2026-07-26