llama.cpp v0.4.0 ships Qwen3.8-Flash-Next support, sparse flash attention, and RDMA

solyarisoftware · x · 2026-09-05

llama.cpp released v0.4.0 with notable additions:

Also includes session/state version bumps and a maxbufsize quantization parameter.

Original post →

More from Infra

Infra channel →