RTX 3060 跑 Qwen 27B 量化模型:完整 llama.cpp 配置达 10-20 tokens/s
SummarizedAnu · reddit · 2026-09-10
Reddit 用户分享在 RTX 3060(12GB)上用 llama.cpp 运行 Qwen3.8-27B 的 IQ3XXS 量化版(GSQ-RCO-MTP GGUF)的完整实战配置:
- 性能:生成速度约 10-20 tokens/s,prompt 处理约 334 tokens/s,开启推理关闭与 MTP 投机解码(draft acceptance 约 0.41),加载完整模型和 64K 上下文 KV cache 后仍余 1GB 显存。
- 关键配置:q40 KV cache 量化、--override-tensor 把第 10-16 层强制放到 GPU、--spec-type draft-mtp 投机解码、flash attention 开启等,命令行参数完整贴出。
- 作者还链接了社区维护的 RTX 3060 部署指南,并表示有部署问题可以在帖内提问。
对想在消费级显卡上本地跑 27B 级模型的人是很具体的参考。
「Infra」频道最新
- GPT-6 Astra 预训练成本曝光:约 4.32 亿美元 — scaling01 · 2026-09-10
- Gensyn 开源 IR3DE-AXL 原型:无中心网关的集体推理网络 — benfielding · 2026-09-10
- Sam Altman:六年后人均月耗或达 5000 亿 token — rohanpaul_ai · 2026-09-10
- 报告:AI 服务器正分裂为三个市场,约 100-150 万台本地服务器待换新 — BenBajarin · 2026-09-10
- Marvell 加码扩产押注规模化,分析师点出基板产能是AI芯片稀缺环节 — BenBajarin · 2026-09-10
- MLX Fast优化Gemma 4 26B:并发解码提速160%,42名贡献者参与 — gajesh · 2026-09-10