4060 Ti 16GB 跑 27B 模型 6-7 t/s,本地推理还能怎么榨速度
thatoneshadowclone · reddit · 2026-09-03
作者在 4060 Ti 16GB + 32GB 内存上用 llama.cpp 跑 Qwen 27B(IQ3S Unsloth 量化)作编码 agent,推理阶段约 6-7 t/s,代码生成约 11 t/s,一个任务约需 1-1.5 小时,发帖征求进一步提速建议。
当前配置要点:双 GGUF(主模型 + DFlash2-Q4KM 草稿模型)做 draft-dflash 推测解码(最多 3 步)、-nkvo 关闭 KV cache、128K 上下文、-fa on、KV cache 量化为 q80、batch 2048/ub 512、双层 GPU offload。作者认为大上下文比速度更重要,但想知道还有没有遗漏的优化空间。
「Infra」频道最新
- Reliance Jio 推云电脑 JioPC,每天 11 卢比虚拟一台 PC — NirantK · 2026-09-03
- Arm CEO 对谈:从 IP 授权到造芯,CPU 仍是 AI 时代心脏 — No Priors · 2026-09-03
- 开源项目 ARBR:给多模型流量加路由与治理层,自动降本不掉质 — Genie-Tickle-007 · 2026-09-03
- Arm CEO 做客 No Priors:从 IP 授权转向造芯,为 Meta 打造 AGI CPU — No Priors · 2026-09-03
- ClickHouse CEO:Agent 查询模式不可预测,延迟成可观测性关键 — bibryam · 2026-09-03
- 踩坑提醒:DeepEP 与 RoCE 组合不可用 — TheZachMueller · 2026-09-03