16GB 显存跑 Qwen3.8-27B 提速到 20 tok/s 的调优指南
BassAzayda · reddit · 2026-08-18
作者在 RTX 5070 Ti(16GB VRAM)+ 64GB 内存上把 Qwen3.8-27B 的生成速度从 8–12 tok/s 提升到约 18–20 tok/s,同时保住 65k 上下文的 q80 KV Cache 质量。核心思路是放弃传统的 -ngl 整层卸载,改用 --override-tensor 只把 FFN 权重矩阵(每 3 层卸 1 层)放到 CPU,腾出约 2.8GB 显存,让全部 Attention 算子留在 GPU 上。
其他要点:
- 用 MTP 投机解码(--spec-type draft-mtp,draft 长度 2)带来 30–50% 吞吐提升;
- 生成线程 -t 8 绑物理性能核,prefill 批处理线程 -tb 16 用超线程;
- RTX 50 系/Blackwell 上设 GGMLCUDADISABLEGRAPHS=1 避免 CUDA graph 捕获卡顿。
帖内附完整 llama-server 启动脚本(IQ4XS 量化、65,536 上下文、q80 KV cache、prefix cache 等参数齐全),可直接照抄使用。
所属事件:16GB 显存优化 Qwen3.8-27B 提速至 20 tok/s(2 条相关)→
「Infra」频道最新
- OpenRouter 年度 token 用量从 3.73T 暴涨至 75T 以上 — scaling01 · 2026-08-18
- 民调:水电气成反对数据中心建设主因 — soumitrashukla9 · 2026-08-18
- 传 Crusoe 寻求 IPO,估值或达 350 亿美元 — nwilliams030 · 2026-08-18
- MiniMax H3 动态工作流:16GB 显存跑 4 秒步数 — DaExChef · 2026-08-18
- ComfyUI 更新后 MiniMax H3 生成质量严重下降 — ASK_ABT_MY_USERNAME · 2026-08-18
- 网友拟开放 Qwen 3.8 27B 本地服务,每秒 56 Token — No_Run8812 · 2026-08-18