RTX 5090 多机跑 Qwen3.8 BF16 实测
stargate425 · reddit · 2026-08-31
在 RTX PRO 6000、RTX 5090 和 Mac Pro 上通过 llama.cpp RPC 分布式运行 Qwen3.8-Flash-Next BF16 (无量化),解码速度 6.43 t/s。发现仍有 39GB 溢出到内存,正通过 RPC 统计排查 155ms/token 中的网络延迟瓶颈。
「Infra」频道最新
- Medusa 从训练到推理全解:多 token 预测加速的两部曲教程 — No_Progress_5399 · 2026-08-31
- 曝 OpenAI 大量采购 Mac Studio 做 RL 训练 — SumitGup · 2026-08-31
- 数据中心建设报道应借鉴昔日电报电缆铺设法 — jwt0625 · 2026-08-31
- 新项目 gpu_api 推出极简 API,持续优化图形渲染体验 — Michael_Moroz_ · 2026-08-31
- Hugging Face 用开源模型防御,前沿 API 防不住 — AlexTensor · 2026-08-31
- 深入探讨机器神明的血液供应:AI 算力经济详解 — ZeroStateReflex · 2026-08-31