重置 Windows 后,RTX 3070 的本地 Qwen3.6-35B 吞吐恢复了
campaigner_ · reddit · 2026-08-04
作者发现自己在 RTX 3070 上的 tokens/s 直接减半,最后追查到是 Windows 里的软件问题;通过重置系统后,问题被解决了。
重置之后,这套机器在 81,920 上下文下回到约 30 tps,继续把上下文拉到 130k 仍能维持约 27 tps。帖子给出了完整的 llama-server 启动参数,模型是 Qwen3.6-35B-A3B-UD-Q4KXL.gguf,并启用了 --gpu-layers 99、--cpu-moe、--cache-type-k/v q80 等调优选项。
作者的结论很直接:如果吞吐异常长期查不出来,先做一次干净的 Windows 重置,可能比继续折腾 CUDA 和命令行更有效。
所属事件:排查Windows系统异常致本地大模型推理降速(2 条相关)→
「Infra」频道最新
- 美国中部对 AI 数据中心的反弹正在升温 — altryne · 2026-08-04
- 半导体和数据中心的扩张,远慢于 AI 需求 — robleclerc · 2026-08-04
- Gemma 4 31B 的 KV Cache 内存开销比 DeepSeek V4 Flash 高 13 倍 — teortaxesTex · 2026-08-04
- 面向嵌入式板卡的 MCP 服务器支持结构化编译刷写调试 — Historical_Court795 · 2026-08-04
- 一篇技术文章聚焦实时推理、动态压缩和 WebRTC 优化 — juberti · 2026-08-04
- Databricks 在 Kimi K3 基准中拿下最快与最低延迟 — mrdrozdov · 2026-08-04