双R9700跑Qwen3-27B-FP8仅50 t/s,vLLM推测解码瓶颈排查
YehowaH · reddit · 2026-08-24
用户在 2 张 AMD R9700 AI Pro(TP=2,PCIe Gen5 x8,AMD Ryzen 5 7400 + DDR5-6000)上用 vLLM 部署官方 Qwen3-27B-FP8 并开启 MTP=3 推测解码,实际生成吞吐仅约 50 t/s,接受吞吐约 30 t/s,平均接受长度 2.7-2.8,草稿接受率约 60%。环境基于 andysalerno/r9700-serving 仓库(统一 aiter attention、ROCm 7.14、最新 vLLM/FlashAttention/aiter)。作者向社区求证该数字是否合理、瓶颈可能在哪。
「Infra」频道最新
- AI 智能体支付协议之争:x402 领先,Stripe 入局 — MountainAssignment36 · 2026-08-24
- Google Gemma-4-26B 成功移植 Apple Silicon,显存占用减半 — jasonkneen · 2026-08-24
- 主权 AI 基础设施缺口达 1.5 万亿,硅谷主导地位终结 — mikeflache · 2026-08-24
- 求助:如何为 Deepseek v4 Flash 集成视觉编码器? — StartupTim · 2026-08-24
- 曝 Mac 本地 Agent 运维方案:合盖不休眠与云端 Mac 集群 — tedddyoweh · 2026-08-24
- Context Layer:用户控制的跨模型/Agent上下文传输协议 — sierracatalina · 2026-08-24