排查Windows系统异常致本地大模型推理降速
一名开发者在 RTX 3070 显卡上使用 llama.cpp 本地运行 Qwen 模型时,遭遇了推理速度(TPS)突然减半的离奇故障。经过排查,发现问题并非源于硬件,而是 Windows 系统内的软件异常所致。在果断重置 Windows 系统后,该机器的本地推理吞吐量成功恢复正常,顺利跑满了 81,920 的上下文。
2026-08-02 ~ 2026-08-04 · 2 条相关
- llama.cpp本地推理排错:TPS突然减半的坑 — campaigner_ · 2026-08-02
- 重置 Windows 后,RTX 3070 的本地 Qwen3.6-35B 吞吐恢复了 — campaigner_ · 2026-08-04