llama.cpp adds Vulkan INT8 coopmat matmul for AMD RDNA3/4, boosting 7900XTX prefill 25%+

nickm_27 · reddit · 2026-09-24

A merged llama.cpp change adds a Vulkan int8 coopmat1 matmul implementation for AMD RDNA3/RDNA4 GPUs. Benchmarked on a 7900XTX with gemma4 26B.A4B Q40, pp512 jumped from 3410.5 to 4331.2 t/s (27% faster), and long-context prefill at d16384 rose from 2130 to 2402 t/s; tg128 also improved slightly. A free, meaningful speedup for local inference on AMD cards.

Original post →

More from Infra

Infra channel →