KV Cache 移植实验:Q6 起步 Q3 续跑,质量反超全程低量化

wadeAlexC · reddit · 2026-09-26

作者受 Cache-to-Cache 论文(arXiv:2510.03215)启发——该论文用小网络把不同模型的 KV cache 直接语义融合,替代 agent 间文本传递——验证了一个想法:同一模型不同量化之间的 KV cache 能否互通?在 Qwen3.8-27B 上用 NIAH 式难题做了对比实验:

结果:高精度起步、低量化接管的动态策略,在相同显存预算下质量超过全程低精度运行——说明同模型不同量化间无需训练转换器即可复用 KV cache。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →