排查Windows系统异常致本地大模型推理降速

一名开发者在 RTX 3070 显卡上使用 llama.cpp 本地运行 Qwen 模型时,遭遇了推理速度(TPS)突然减半的离奇故障。经过排查,发现问题并非源于硬件,而是 Windows 系统内的软件异常所致。在果断重置 Windows 系统后,该机器的本地推理吞吐量成功恢复正常,顺利跑满了 81,920 的上下文。

2026-08-02 ~ 2026-08-04 · 2 条相关