发现KV缓存量化评测盲点,2-bit方案追平KIVI
Interesting-Owl6064 · reddit · 2026-07-05
作者聚焦小 GPU 长上下文推理的 KV 缓存压缩,发现主流评测存在盲点:许多 KV 量化的 perplexity 检测是在禁用缓存的单次前向传播下做的,模型读取的是全精度值、量化器根本没运行,导致 fp16、4-bit、2-bit 给出完全相同的困惑度(3.6416),无法反映 value cache 的量化误差。他改用“先 prefill 再逐 token 解码”的缓存路径测试。
方法上:先用 Hadamard 矩阵旋转 value 向量再量化到 2-bit 均匀分布(旋转分散离群值,且矩阵自逆可在 attention 求和后免费还原),key 仍用 KIVI int4。在修正后的指标上,其 2-bit value cache 质量与 KIVI 4-bit 三位小数一致,显存少约 20%、约为 fp16 的 1/4,在 Llama 2 7B 与 TinyLlama 上成立并在第二台机器复现。诚实的局限:仅对比 KIVI 未对比最新旋转方法;无融合 kernel 时解码慢 6%–12%。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11