Qwen3.6 的 KV Cache 量化显存对比

token---- · reddit · 2026-07-19

帖子在讨论 **Qwen3.6-35B-A3B** 的 **KV cache 量化** 与显存占用,核心问题是:为了省内存,把 KV cache 量化到低于 **Q8** 是否值得,以及会带来多大性能/质量代价。 配图给出了在不同 **context length** 下、不同 KV 配置的 **VRAM 使用曲线**。可以看到上下文越长,显存差异被迅速放大;其中未量化方案占用最高,而更激进的量化组合能显著降低显存压力,适合长上下文推理场景。 这类内容更偏向推理部署与内存优化,而不是单纯模型能力讨论。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →