Local Qwen runs at 27t/s in chat but drops to 15t/s inside agent harnesses

WizardlyBump17 · reddit · 2026-08-23

A user running Qwen3.6 35B A3B locally via llama.cpp (Intel B580 + 7 5700X3D + 48GB RAM) gets 27 tok/s in normal chat but only 15 tok/s inside coding harnesses like OpenCode and Maki, even with less context. Full Docker launch config (262K ctx, Q80 KV cache, MTP speculative decoding) included; asking why harnesses slow inference down.

Original post →

More from coding & agent

coding & agent channel →