3张2080Ti跑Qwen 27B达55tps,最佳配置分享
AccountGotLocked69 · reddit · 2026-08-01
一位开发者在 3x RTX 2080 Ti (11GB) 和 Threadripper 3970X 的硬件配置下,使用 llama.cpp 跑 Qwen 27B Q5 模型,实现了 55 tokens/s 的生成速度。
他分享了当前调优出的最佳启动参数,核心优化点包括:
- 开启 flash-attn 注意力机制
- 将 KV cache 压缩为 q80 精度
- 使用 tensor 分割模式并关闭 mmap
- 启用 draft-mtp 进行推测性解码(最大 draft 数为 3)
「Infra」频道最新
- DeepSeek V4 Flash 本地跑分追平 5 个月前顶级模型 — joorklee · 2026-08-01
- 新方法实现MoE模型提前路由,大幅优化端侧流式推理I/O瓶颈 — dai_app · 2026-08-01
- 5TB数据存储于微小玻璃片,微观存储技术新突破 — TansuYegen · 2026-08-01
- antirez 实现 DeepSeek v4 Flash 无损 MXFP4 本地运行 — antirez · 2026-08-01
- 开源引擎Waste:29GB内存即可跑Kimi K3 — galapag0 · 2026-08-01
- DeepSeek-V3训练仅用18万GPU小时,极致摊薄MoE算力成本 — teortaxesTex · 2026-08-01