研究揭示 KV 缓存打分无用:随机驱逐即可换来 32-43% 更高吞吐
burny_tech · x · 2026-09-04
UIUC 等机构的新论文《Random Attention》发现,现有 KV cache 驱逐方法的核心范式——给缓存 token 打分保留高分——几乎不带来收益。
- 方法:Random Attention 保留 prompt 部分的缓存,在每个注意力头内均匀随机驱逐推理 token,完全不做打分
- 结果:在 4 个模型、6 个推理任务上与最强驱逐器持平,vLLM 部署下吞吐高出 32-43%
- 解释:prompt 是缓存中最脆弱、最关键的部分,各打分器的差距其实只在于是否碰巧保住了 prompt;推理轨迹靠文本冗余和跨注意力头的多副本自我保护,随机保留就足够
- 论文与代码已开源
所属事件:研究称 KV Cache 驱逐打分无用 随机淘汰即可提升吞吐(2 条相关)→
「Infra」频道最新
- 马斯克转发招聘:Memphis 超算团队大规模扩建,急招工程与数据中心人员 — elonmusk · 2026-09-04
- Salesforce 研究:随机淘汰推理 token 即可高效压缩 KV Cache — Salesforce · 2026-09-04
- 安全从业者自建本地红队 AI harness:求 Mac 硬件与本地模型选型建议 — CivilBug4007 · 2026-09-04
- 马斯克:必须同时拿下 AI 芯片与模型,双线闭环定胜负 — r0ck3t23 · 2026-09-04
- Gimlet Labs 融资 3 亿美元,估值达 30 亿,主攻异构芯片分派 AI 任务 — dinabass · 2026-09-04
- lightseekorg 开源 Kimi K3 三个草稿模型及训练配方 — AccBalanced · 2026-09-04