双 5090 跨机 RPC 跑 Qwen:解码 90-100 tok/s,预填充 3000 tok/s

ilarp · reddit · 2026-09-16

一位用户用 ConnectX-5 100G 网卡把两台各装一块 RTX 5090 的机器连起来,通过 llama RPC 分布式运行 Qwen(unsloth 量化,Q2 档),实测解码 90-100 tok/s、预填充约 3000 tok/s。

他想知道单机双 5090 或 6000 Pro 用户的对比数据,并坦承实践中没觉得这套大模型方案比直接跑 27B 模型好多少——对分布式推理性价比感兴趣的读者可参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →