双 5090 跨机 RPC 跑 Qwen:解码 90-100 tok/s,预填充 3000 tok/s
ilarp · reddit · 2026-09-16
一位用户用 ConnectX-5 100G 网卡把两台各装一块 RTX 5090 的机器连起来,通过 llama RPC 分布式运行 Qwen(unsloth 量化,Q2 档),实测解码 90-100 tok/s、预填充约 3000 tok/s。
他想知道单机双 5090 或 6000 Pro 用户的对比数据,并坦承实践中没觉得这套大模型方案比直接跑 27B 模型好多少——对分布式推理性价比感兴趣的读者可参考。
「Infra」频道最新
- Lithos 团队:别拿 benchmark 当选型铁证,先定义自身指标 — JiaZhihao · 2026-09-16
- 便宜开源 LLM 第三方渠道排名:coral bricks 凭 GLM Flash 居首 — opensourcecolumbus · 2026-09-16
- 用 Xbox 当本地 AI 主机?16GB 统一内存的脑洞可行吗 — RecursiveCTE · 2026-09-16
- Rob Mulla 入职 Google 一周年:TPU 推理与 vLLM 扩展工作回顾 — Rob_Mulla · 2026-09-16
- Jev 宣称新前沿模型便宜 40-400 倍、速度快 20-200 倍 — albelfio · 2026-09-16
- Nvidia B200 算力价格单月涨 21%,AI 需求持续超预期 — JOBhakdi · 2026-09-16