halogen 0.12.0 hits 38 tok/s decode at 1M context for Qwen on Strix Halo

peonist-ai · reddit · 2026-09-20

peonist-ai released halogen-flash-server 0.12.0, fixing context-depth performance degradation for Qwen3.8-Flash-Next on AMD's Ryzen AI Max+ 395 (128GB Strix Halo).

Original post →

More from Infra

Infra channel →