Qwen3.6 的 KV Cache 量化显存对比
token---- · reddit · 2026-07-19
帖子在讨论 Qwen3.6-35B-A3B 的 KV cache 量化 与显存占用,核心问题是:为了省内存,把 KV cache 量化到低于 Q8 是否值得,以及会带来多大性能/质量代价。
配图给出了在不同 context length 下、不同 KV 配置的 VRAM 使用曲线。可以看到上下文越长,显存差异被迅速放大;其中未量化方案占用最高,而更激进的量化组合能显著降低显存压力,适合长上下文推理场景。
这类内容更偏向推理部署与内存优化,而不是单纯模型能力讨论。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11