Windows 下 LLM 推理慢 2-3 倍?把服务窗口切后台即解决

koloved · reddit · 2026-09-10

Reddit 用户在 RTX 5090 上跑约 27B NVFP4 模型(ninfer)时发现:终端窗口失焦时推理速度从 130-200 tok/s 暴跌到 50-60 tok/s,点击窗口立刻恢复。

排查过程很扎实:

这是 Windows 11 前后台 CPU 调度行为导致的坑,本地推理用户值得记住。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →