vLLM 和 Ray 能否把热专家挪到 RTX 5090 上

2thleZ · reddit · 2026-07-26

一位用户在研究,能不能把 vLLM + Ray 摆进一个混合硬件环境里:两台 DGX Sparks 加上一台 RTX 5090,通过 ConnectX-7 组网。

他的目标是:让 300B / 150GB 的 MoE 模型在 Sparks 上维持类似 TP=2 的结构,同时把 attention head 和“热专家”尽量放到更快的 5090 GDDR7 上。

他还提到,这套网络对 NVMe 权重加载很有帮助,权重在每台 Spark 上的加载速度大约能到 20 Gb/s,而且驱动原生支持,所以 ConnectX-7 和线材的投入是值得的。现在的问题是:要怎样改 Ray/vLLM 的调度,才能真的把计算偏向更小更快的 CUDA 设备,同时把大部分闲置专家留在 Sparks 上?

所属事件:vLLM与Ray异构组网部署大模型实践(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →