双 3060 跑 Qwen 27B Q4 量化,实测生成速度约 44-50 tok/s
jacek2023 · reddit · 2026-09-26
作者平时用 4x3090 跑 Qwen3.8-27B(parallel=2 同时跑两个 agent),因需临时挪用机器,改在 2xRTX 3060 的机器上用 llama.cpp 跑 Qwen3.8-27B 的 UD-Q4KM 量化版。
关键做法与结果:
- 使用 llama-server,开启张量并行(-sm tensor)、FlashAttention、50K 上下文、ngram-mod + draft-mtp 推测解码(draft 最多 3 token)、preservethinking 等参数,完整命令见原文
- 实测速度:生成约 43-50 tok/s,prompt 处理可到 198 tok/s,日常可用
- 结论:老 3060 双卡对本地 LLM 仍有实用价值
「Infra」频道最新
- Anthropic 与 OpenAI 标价相同但缓存读取价差 4 倍,价目表不等于真实价格 — julsimon · 2026-09-26
- ASML 财报:EMMEA 销售占比从 4.7% 跌至零,欧洲在建 2015 年制程芯片 — julsimon · 2026-09-26
- Glamsterdam 升级将用状态快照取代修复阶段,节点同步再提速 — banteg · 2026-09-26
- 20 万卡 GB300 集群只有 10% MFU?社区热议 xAI 算力效率 — teortaxesTex · 2026-09-26
- 英伟达市值 5.4 万亿美元,超过英法德任一国股市总市值 — iamfakhrealam · 2026-09-26
- SemiAnalysis 拆解 DeepSeek V4.1 Flash:Engram 查表换 1.6 倍性价比 — teortaxesTex · 2026-09-26