实测:27B 模型塞进 12GB 显存+8GB 内存,仍有约 18 tok/s
bodhi371 · reddit · 2026-10-07
网友 bodhi371 分享了在 12GB 显存 + 8GB 内存上跑 Qwen3.8-27B 的完整方案,实测解码约 18 tok/s、64k 上下文下预填充 500-600 tok/s:
- 量化选择:ISTA-DASLab 的 GSQ-RCO IQ3S 量化版(约 11GB),作者测遍各种量化后认为这是最佳选择;0bserverx 的 Heretic 版也可用(约慢 7%)。
- 为何装得下:Qwen3.8 是混合架构,64 层中仅 16 层需要 KV cache;用 q40 存 KV 后 64k 上下文只占约 1.1GB(f16 则要 4GB)。
- 硬件与参数:9900X + 4070S 12GB + 32GB 内存,原版 llama.cpp,参数 -ngl 58 -ot tokenembd=CPU -ctk q40 -ctv q40 -c 64000。
完整构建与运行脚本及数据见 GitHub 仓库 bodhi37/Qwen3.8-27B-12GBVRAM-Recipe。
所属事件:低配硬件实测跑 Qwen3.8 27B:12GB 显存即可胜任(2 条相关)→
「Infra」频道最新
- 谁承担资金风险谁有议价权:从押金结构看 AI 算力真稀缺在哪 — tengyanAI · 2026-10-07
- vLLM v0.31.0 发布:717 个提交,vllm preload 让量化权重常驻显存免重启 — lmoroney · 2026-10-07
- AI 爬虫日刷 12 万请求压垮网站,站长怒封 ClaudeBot 一族 — burkov · 2026-10-07
- 便宜层做 1000 亿决策、Opus 只探 96 次:分层 agent 流水线实测 — Arindam_1729 · 2026-10-07
- FastVideo FastH3 已可在单张消费级显卡上运行 — fruesome · 2026-10-07
- OpenSBI 与 Linux 成功启动 Maxion 核心内核,移植工作主要由 Agent 完成 — glenbeer · 2026-10-07