12GB 显存可跑 27B 模型,Qwen 3.8 量化实测
Square_Light1441 · reddit · 2026-08-28
Reddit 用户分享了 Qwen 3.8 27B 模型的高效量化方案:结合 QAT Q2 权重量化与 Q5 KV Cache,总显存占用仅 13-14GB。实测显示,在 100K 上下文窗口下,该配置可在 12GB 显存中运行,且性能损失极小,能力被认为超越 Claude Sonnet 4.6。
所属事件:Qwen 3.8 27B 量化实测:低显存跑超长上下文(2 条相关)→
「Infra」频道最新
- Autonomous 推出双卡 RTX 5090 工作站,26100 美元起 — dee_hw · 2026-08-28
- oMLX 0.6.3 发布:Qwen 与 GLM 闪存模型支持,解码提速 160% — HankYeomans · 2026-08-28
- vLLM 深度测评:MTP、EAGLE 等 5 种推测解码在 AMD 显卡上的实战表现 — vllm_project · 2026-08-28
- 数据中心扩容带动降费,美电力公司拟年省 7900 万美元 — toptickcrypto · 2026-08-28
- 为何 AI 数据中心仍依赖水冷而非空气冷却? — wren337 · 2026-08-28
- 微软教程:如何在 Foundry 资源中配置 AI 网关 — adnan_hashmi · 2026-08-28