gufo-Qwen3.6-35B hits 3095 tok/s prefill, 190 tok/s decode on Strix Halo

nubela · reddit · 2026-10-03

A Reddit user shared local inference benchmarks for gufo-Qwen3.6-35B-A3B-Q6dense on AMD's Strix Halo: 3095 tok/s prefill and 190 tok/s decode. The model is open-sourced on GitHub, a useful datapoint for consumer-grade local LLM deployment.

Original post →

More from Infra

Infra channel →