RTX 5090 多机跑 Qwen3.8 BF16 实测

stargate425 · reddit · 2026-08-31

在 RTX PRO 6000、RTX 5090 和 Mac Pro 上通过 llama.cpp RPC 分布式运行 Qwen3.8-Flash-Next BF16 (无量化),解码速度 6.43 t/s。发现仍有 39GB 溢出到内存,正通过 RPC 统计排查 155ms/token 中的网络延迟瓶颈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →