随机删缓存也行?研究揭示KV Cache驱逐机制被高估
机器之心 · wechat · 2026-09-19
Salesforce AI Research 与 UIUC 的最新论文提出 RandomAttention:完整保护输入 Prompt,对其余推理链的 KV 在每个 KV head 内独立随机保留,不做任何内容相关的重要性打分。
结果反直觉:在 Qwen3-4B/14B/32B 和 Phi-4-reasoning 四个模型、六个数学/科学/代码任务上,约 4× KV Cache 压缩下它整体媲美最强基线,60 组对比中显著领先 31 个、仅落后 1 个;集成进 vLLM 的 32k token serving 测试中,因省掉 scoring pass,吞吐比 TriAttention 再高 32%–43%。
论文进一步拆解原因:一是很多方法的收益其实来自恰好保护了 Prompt——统一加 Prompt 保护后,SnapKV、VaSE 等基线差距缩到 2.2 个百分点内;二是推理链有文本重述和跨 head 副本两层冗余,planted-fact 探针显示事实保存在 8 个 head 中检索可达 99%。但对只出现一次、久不重述的孤立事实(如 passcode),随机法准确率归零,说明 selection signal 在 needle 检索上仍有价值。代码与项目主页已开源。
「Infra」频道最新
- DiffusionGemma 变身 DJev,手机上近实时跑视觉检测 — PMinervini · 2026-09-19
- 35B 三值模型塞进 iPhone:Millie 仅约 4GB 内存离线运行 — MannyKayy · 2026-09-19
- Reddit 网友魔改 llama.cpp:双卡异构跑 Qwen3 27B 至 262k 上下文 — comperr · 2026-09-19
- PyTorch 大会将演示 CRCR:下游仓库可无缝接入上游 CI — PyTorch · 2026-09-19
- 内罗毕首届 Cafe Compute 聚会演示 Cerebras,呼吁推理层可解释性 — paw_lean · 2026-09-19
- Cerebras 用 Qwen 27B 打造购房理财助手 Money Agent — Alibaba_Qwen · 2026-09-19