Windows 下 LLM 推理慢 2-3 倍?把服务窗口切后台即解决
koloved · reddit · 2026-09-10
Reddit 用户在 RTX 5090 上跑约 27B NVFP4 模型(ninfer)时发现:终端窗口失焦时推理速度从 130-200 tok/s 暴跌到 50-60 tok/s,点击窗口立刻恢复。
排查过程很扎实:
- 不是 GPU 降频:慢速时 SM 时钟反而更高(2550-2600 MHz),功耗同为 400W,PCIe 无降速,decode-host 耗时不变
- 真正差异在 wait 时间:失焦时 38-41 ms,聚焦时 16-17 ms——是 CPU 侧服务循环被 Windows 前后台调度延迟了
- 修复方法:以 detached/headless 方式运行服务(docker run -d),wait 稳定在 17ms 左右,吞吐恢复 130-200 tok/s
- 原生 Windows 构建也能复现,排除 WSL2 特有 bug
这是 Windows 11 前后台 CPU 调度行为导致的坑,本地推理用户值得记住。
「Infra」频道最新
- turbovec 用 Rust 把 1000 万向量塞进 4GB 内存,检索还快过 FAISS — tom_doerr · 2026-09-10
- LM Studio 0.4.24 发布:支持高级 llama.cpp 参数覆盖与多项修复 — solyarisoftware · 2026-09-10
- tszzl 补充论证:算法效率提升只会放大对硬件的渴望 — tszzl · 2026-09-10
- 裁剪 MTP 草稿词表至 47k,DGX Spark 上解码提速 21.5% — MaziyarPanahi · 2026-09-10
- 5t/s 的本地模型算能用吗?Reddit 网友实测 27B 模型 — Zombiecidialfreak · 2026-09-10
- 投机解码深度博客预告:算术强度、 drafter 训练与 vLLM 部署 — auto_grad_ · 2026-09-10