KV Cache 移植实验:Q6 起步 Q3 续跑,质量反超全程低量化
wadeAlexC · reddit · 2026-09-26
作者受 Cache-to-Cache 论文(arXiv:2510.03215)启发——该论文用小网络把不同模型的 KV cache 直接语义融合,替代 agent 间文本传递——验证了一个想法:同一模型不同量化之间的 KV cache 能否互通?在 Qwen3.8-27B 上用 NIAH 式难题做了对比实验:
- 静态基线:单用量化 IQ3S、Q4KXL、Q6K(后者需 >24GB 显存)
- 动态策略 1:Q6K 起步 → 换 Q4KXL → 换 IQ3S(f16 KV cache)
- 动态策略 2:Q6K 起步 → KV cache 量化到 q80 → 换 Q4KXL → 再量化,适配 24GB 显存
结果:高精度起步、低量化接管的动态策略,在相同显存预算下质量超过全程低精度运行——说明同模型不同量化间无需训练转换器即可复用 KV cache。
「Infra」频道最新
- Vpipe 对比 Draw Things:Mac 本地生图快 22-24%,2K 下更稳定 — TgoAI · 2026-09-26
- AMD 发布 Helios GPU 教学版 GEMM 优化阶梯:从基线到峰值性能 — salykova_ · 2026-09-26
- Terafab 启动招聘:目标年产 1TW 芯片,剑指轨道 AI 算力 — seanmcdonaldxyz · 2026-09-26
- 从单节点到百万节点:作者分享 LLM 推理扩容实践博客 — abhijithneil · 2026-09-26
- 三星联合牛津北大推出 TrOPD,让端侧小模型继承大模型推理 — jiqizhixin · 2026-09-26
- LLM API 该按量付费还是承诺用量?真实采购决策的三个问题 — LeviYagami · 2026-09-26