Qwen 3.8 27B 量化实测:低显存跑超长上下文

Reddit 用户分享 Qwen 3.8 27B 模型的多种高效量化方案:结合 QAT Q2 权重量化与 Q5 KV Cache,总显存占用仅约 13-14GB,12-16GB 显存设备即可运行;另有用户在 16GB 显存上以 UD-IQ3XXS 量化实现超过 20 万的上下文窗口,相比 UD-Q3KXL 虽有取舍但整体表现可观,为消费级硬件部署大模型提供了实用参考。

2026-08-28 ~ 2026-08-28 · 2 条相关