Qwen3.8-27B 多卡与 RPC 推理实测:RX 7900 GRE 显存不足
tabletuser_blogspot · reddit · 2026-08-17
作者测试了 Qwen3.8-27B 在多种硬件配置和 llama.cpp RPC 模式下的推理性能。主要配置包括单张 RX 7900 GRE、RX 7900 GRE+GTX 1080Ti、以及 GTX 1080Ti+双 P102-100。测试发现,单张 RX 7900 GRE 显存不足(16GB)无法完全加载模型;使用 RPC 拆分至多张 GPU 后,Q4KM 量化下吞吐量约为 71-106 t/s,Q6K 约为 80-116 t/s。对比发现,双 GPU 和三 GPU 在推理速度上差异不大,但加载时间更长。
「Infra」频道最新
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17
- 麦肯锡:自 22 年底美数据中心投资激增 200% — rvp · 2026-08-17
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17
- 250 美元 FPGA 开发板实现 12000 tok/s 推理 — ycombinator · 2026-08-17
- Qwen3.8 实测:MTP 参数影响吞吐,Q4 精度胜过 Q8 — New-Inspection7034 · 2026-08-17
- 12GB 显卡实测:Qwen3.8 27B Q2 可用,MoE 更优 — CoffeeToCode99 · 2026-08-17