发现KV缓存量化评测盲点,2-bit方案追平KIVI
Interesting-Owl6064 · reddit · 2026-07-05
作者聚焦小 GPU 长上下文推理的 KV 缓存压缩,发现主流评测存在盲点:许多 KV 量化的 perplexity 检测是在禁用缓存的单次前向传播下做的,模型读取的是全精度值、量化器根本没运行,导致 fp16、4-bit、2-bit 给出完全相同的困惑度(3.6416),无法反映 value cache 的量化误差。他改用“先 prefill 再逐 token 解码”的缓存路径测试。
方法上:先用 Hadamard 矩阵旋转 value 向量再量化到 2-bit 均匀分布(旋转分散离群值,且矩阵自逆可在 attention 求和后免费还原),key 仍用 KIVI int4。在修正后的指标上,其 2-bit value cache 质量与 KIVI 4-bit 三位小数一致,显存少约 20%、约为 fp16 的 1/4,在 Llama 2 7B 与 TinyLlama 上成立并在第二台机器复现。诚实的局限:仅对比 KIVI 未对比最新旋转方法;无融合 kernel 时解码慢 6%–12%。
「Infra」频道最新
- WEKA NeuralMesh 被指在 GPU 服务器上可接近 HBM3 带宽 — AccBalanced · 2026-07-27
- Nvidia 被调侃成开源 AI 领头羊,仓库图却真排第一 — AccBalanced · 2026-07-27
- 8 美元 ESP32-S3 竟能离线跑 2890 万参数模型 — yangyi · 2026-07-27
- YC 演讲谈 BCI × AI:真正决定速度的是基础设施 — garrytan · 2026-07-27
- 13B 模型靠 SSD 分页在无独显电脑上离线跑通 — ID_R_McGregor · 2026-07-27
- llama.cpp 提醒:旧版 GGUF 在新改动后必须重生成 — EconomySerious · 2026-07-27