16GB 显存跑 Qwen3.8-27B 提速到 20 tok/s 的调优指南

BassAzayda · reddit · 2026-08-18

作者在 RTX 5070 Ti(16GB VRAM)+ 64GB 内存上把 Qwen3.8-27B 的生成速度从 8–12 tok/s 提升到约 18–20 tok/s,同时保住 65k 上下文的 q80 KV Cache 质量。核心思路是放弃传统的 -ngl 整层卸载,改用 --override-tensor 只把 FFN 权重矩阵(每 3 层卸 1 层)放到 CPU,腾出约 2.8GB 显存,让全部 Attention 算子留在 GPU 上。

其他要点:

帖内附完整 llama-server 启动脚本(IQ4XS 量化、65,536 上下文、q80 KV cache、prefix cache 等参数齐全),可直接照抄使用。

所属事件:16GB 显存优化 Qwen3.8-27B 提速至 20 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →