Dual R9700 RDNA4 Setup Hits 5000 tok/s Prefill on Qwen 3.8 27B, Seeks Better Engines

N34257 · reddit · 2026-10-06

A user runs Qwen 3.8 27B FP8 on dual AMD R9700 (RDNA4) GPUs via vllm-radiance, achieving 5000 tok/s prefill and 130+ tok/s code generation. They're asking whether other architecture-specific inference engines can do better, especially for Qwen 3.8 Flash Next, which vllm-radiance doesn't yet support and llama.cpp performance would be a regression.

Original post →

More from Infra

Infra channel →