随机删缓存也行?研究揭示KV Cache驱逐机制被高估

机器之心 · wechat · 2026-09-19

Salesforce AI Research 与 UIUC 的最新论文提出 RandomAttention:完整保护输入 Prompt,对其余推理链的 KV 在每个 KV head 内独立随机保留,不做任何内容相关的重要性打分。

结果反直觉:在 Qwen3-4B/14B/32B 和 Phi-4-reasoning 四个模型、六个数学/科学/代码任务上,约 4× KV Cache 压缩下它整体媲美最强基线,60 组对比中显著领先 31 个、仅落后 1 个;集成进 vLLM 的 32k token serving 测试中,因省掉 scoring pass,吞吐比 TriAttention 再高 32%–43%。

论文进一步拆解原因:一是很多方法的收益其实来自恰好保护了 Prompt——统一加 Prompt 保护后,SnapKV、VaSE 等基线差距缩到 2.2 个百分点内;二是推理链有文本重述和跨 head 副本两层冗余,planted-fact 探针显示事实保存在 8 个 head 中检索可达 99%。但对只出现一次、久不重述的孤立事实(如 passcode),随机法准确率归零,说明 selection signal 在 needle 检索上仍有价值。代码与项目主页已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →