重置 Windows 后,RTX 3070 的本地 Qwen3.6-35B 吞吐恢复了

campaigner_ · reddit · 2026-08-04

作者发现自己在 RTX 3070 上的 tokens/s 直接减半,最后追查到是 Windows 里的软件问题;通过重置系统后,问题被解决了。

重置之后,这套机器在 81,920 上下文下回到约 30 tps,继续把上下文拉到 130k 仍能维持约 27 tps。帖子给出了完整的 llama-server 启动参数,模型是 Qwen3.6-35B-A3B-UD-Q4KXL.gguf,并启用了 --gpu-layers 99、--cpu-moe、--cache-type-k/v q80 等调优选项。

作者的结论很直接:如果吞吐异常长期查不出来,先做一次干净的 Windows 重置,可能比继续折腾 CUDA 和命令行更有效。

所属事件:排查Windows系统异常致本地大模型推理降速(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →