4060 Ti 16GB 跑 27B 模型 6-7 t/s,本地推理还能怎么榨速度

thatoneshadowclone · reddit · 2026-09-03

作者在 4060 Ti 16GB + 32GB 内存上用 llama.cpp 跑 Qwen 27B(IQ3S Unsloth 量化)作编码 agent,推理阶段约 6-7 t/s,代码生成约 11 t/s,一个任务约需 1-1.5 小时,发帖征求进一步提速建议。

当前配置要点:双 GGUF(主模型 + DFlash2-Q4KM 草稿模型)做 draft-dflash 推测解码(最多 3 步)、-nkvo 关闭 KV cache、128K 上下文、-fa on、KV cache 量化为 q80、batch 2048/ub 512、双层 GPU offload。作者认为大上下文比速度更重要,但想知道还有没有遗漏的优化空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →