Qwen3.6 的 KV Cache 量化显存对比
token---- · reddit · 2026-07-19
帖子在讨论 **Qwen3.6-35B-A3B** 的 **KV cache 量化** 与显存占用,核心问题是:为了省内存,把 KV cache 量化到低于 **Q8** 是否值得,以及会带来多大性能/质量代价。 配图给出了在不同 **context length** 下、不同 KV 配置的 **VRAM 使用曲线**。可以看到上下文越长,显存差异被迅速放大;其中未量化方案占用最高,而更激进的量化组合能显著降低显存压力,适合长上下文推理场景。 这类内容更偏向推理部署与内存优化,而不是单纯模型能力讨论。
「Infra」频道最新
- 高通预览端侧 GGUF 运行工具GenieX — carrycooldude · 2026-07-20
- DwarfStar 让 Ada 卡盒变推理服务器 — antirez · 2026-07-20
- DwarfStar 新增多项推理优化 — antirez · 2026-07-20
- BMS 在 Vera Rubin 上建 AI 工厂 — nordicinst · 2026-07-20
- Hut 8 签下98亿美元AI租约 — sunychoudhary · 2026-07-20
- 中国开源模型重塑AI经济学 — Stratechery · 2026-07-20