vLLM 和 Ray 能否把热专家挪到 RTX 5090 上
2thleZ · reddit · 2026-07-26
一位用户在研究,能不能把 vLLM + Ray 摆进一个混合硬件环境里:两台 DGX Sparks 加上一台 RTX 5090,通过 ConnectX-7 组网。
他的目标是:让 300B / 150GB 的 MoE 模型在 Sparks 上维持类似 TP=2 的结构,同时把 attention head 和“热专家”尽量放到更快的 5090 GDDR7 上。
他还提到,这套网络对 NVMe 权重加载很有帮助,权重在每台 Spark 上的加载速度大约能到 20 Gb/s,而且驱动原生支持,所以 ConnectX-7 和线材的投入是值得的。现在的问题是:要怎样改 Ray/vLLM 的调度,才能真的把计算偏向更小更快的 CUDA 设备,同时把大部分闲置专家留在 Sparks 上?
所属事件:vLLM与Ray异构组网部署大模型实践(2 条相关)→
「Infra」频道最新
- LLM 配置调优讨论:80K 上下文下 KV cache 取舍 — kingo86 · 2026-07-26
- SK Hynix 直言 HBM 不是 AI 内存墙的终局方案 — rwang07 · 2026-07-26
- vLLM 社区再拉联盟,Inferact 加入开源生态公开信 — vllm_project · 2026-07-26
- Reddit 用户纠结 3000 美元 M1 Ultra 128GB 与 M2 Ultra 64GB — jaqueh · 2026-07-26
- MCP 成功不等于正确,谁来验证工具副作用成了问题 — marcin_michalak · 2026-07-26
- AI 蒸馏撞上知识产权灰区,中国芯片自给已到 41% — Exponential View (Azeem Azhar) · 2026-07-26