Qwen3.8-27B 多卡与 RPC 推理实测:RX 7900 GRE 显存不足

tabletuser_blogspot · reddit · 2026-08-17

作者测试了 Qwen3.8-27B 在多种硬件配置和 llama.cpp RPC 模式下的推理性能。主要配置包括单张 RX 7900 GRE、RX 7900 GRE+GTX 1080Ti、以及 GTX 1080Ti+双 P102-100。测试发现,单张 RX 7900 GRE 显存不足(16GB)无法完全加载模型;使用 RPC 拆分至多张 GPU 后,Q4KM 量化下吞吐量约为 71-106 t/s,Q6K 约为 80-116 t/s。对比发现,双 GPU 和三 GPU 在推理速度上差异不大,但加载时间更长。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →