双R9700跑Qwen3-27B-FP8仅50 t/s,vLLM推测解码瓶颈排查

YehowaH · reddit · 2026-08-24

用户在 2 张 AMD R9700 AI Pro(TP=2,PCIe Gen5 x8,AMD Ryzen 5 7400 + DDR5-6000)上用 vLLM 部署官方 Qwen3-27B-FP8 并开启 MTP=3 推测解码,实际生成吞吐仅约 50 t/s,接受吞吐约 30 t/s,平均接受长度 2.7-2.8,草稿接受率约 60%。环境基于 andysalerno/r9700-serving 仓库(统一 aiter attention、ROCm 7.14、最新 vLLM/FlashAttention/aiter)。作者向社区求证该数字是否合理、瓶颈可能在哪。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →