发现KV缓存量化评测盲点,2-bit方案追平KIVI

Interesting-Owl6064 · reddit · 2026-07-05

作者聚焦小 GPU 长上下文推理的 KV 缓存压缩,发现主流评测存在盲点:许多 KV 量化的 perplexity 检测是在禁用缓存的单次前向传播下做的,模型读取的是全精度值、量化器根本没运行,导致 fp16、4-bit、2-bit 给出完全相同的困惑度(3.6416),无法反映 value cache 的量化误差。他改用“先 prefill 再逐 token 解码”的缓存路径测试。

方法上:先用 Hadamard 矩阵旋转 value 向量再量化到 2-bit 均匀分布(旋转分散离群值,且矩阵自逆可在 attention 求和后免费还原),key 仍用 KIVI int4。在修正后的指标上,其 2-bit value cache 质量与 KIVI 4-bit 三位小数一致,显存少约 20%、约为 fp16 的 1/4,在 Llama 2 7B 与 TinyLlama 上成立并在第二台机器复现。诚实的局限:仅对比 KIVI 未对比最新旋转方法;无融合 kernel 时解码慢 6%–12%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →