Windows local LLM inference 2-3x slower when terminal unfocused; headless fix restores speed

koloved · reddit · 2026-09-10

A Reddit user running a 27B NVFP4 model via ninfer on an RTX 5090 found Windows inference dropped from 130-200 tok/s to 50-60 tok/s whenever the terminal window lost focus.

A Windows 11 foreground/background scheduling quirk every local inference user should know.

Original post →

More from Infra

Infra channel →