Local Qwen3 8B Flash on RTX 6000 Pro: 2000 tps prefill but only 40 tps decode

AppealSame4367 · reddit · 2026-09-04

A user runs Qwen3 8B Flash on a rented RTX 6000 Pro via ikllama (3 slots, 200k context, IQ4 quant, q8 KV cache): 2000 tps prefill but only 40 tps decode for a single request, dropping to 10-20 tps decode with 2-4 parallel requests. vLLM recipes didn't help; they're asking for better configs for 2-4 slots at q4+ quants.

Original post →

More from Infra

Infra channel →