Qwen 3.8 27B runs at only 20t/s on AMD 7900XTX GPU

soyalemujica · reddit · 2026-08-17

A user reported extremely slow inference speeds (20-35 t/s) when running Qwen 3.8 27B on an AMD 7900XTX, even with Speculative MTP enabled at long contexts (80k+). Detailed launch arguments are provided, suspecting architecture or quantization issues.

Original post →

More from Infra

Infra channel →