Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选
jiqizhixin · x · 2026-09-27
推理模型动辄生成数千 token,KV 随序列线性增长,对长推理服务而言 KV Cache 很快成为真正的系统瓶颈。标准解法是 KV cache eviction:设固定预算,持续判断哪些历史 KVs 值得保留、其余删除。多年来方法都在追逐更好的重要性信号——累积历史注意力、关注近期 query、追踪冗余、用 value 幅值或 key 统计量。
Salesforce AI Research 与 UIUC 从一个近乎「反算法」的问题出发:这些精心设计的筛选信号本身是不是问题?
他们提出 Random Attention:不做任何重要性判断,直接随机驱逐,完全省掉昂贵的打分环节。研究显示其效果出人意料地好(原帖截断,结论细节需见原文)。
「Infra」频道最新
- 托管推理三大迷思:单价不是账单、端点不可互换、自建未必省 — TangeloOk9486 · 2026-09-27
- 4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B — ImBadGuyInEveryStory · 2026-09-27
- 自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路 — A_K_Nain · 2026-09-27
- TensorSharp 开源框架支持单请求混合文档/图像/视频/音频证据 — fuzhongkai · 2026-09-27
- 智库学者反数据中心抗议者现场交锋,为算力建设辩护 — neil_chilson · 2026-09-27
- Kafka 上生产才见真章:分区倾斜与消费滞后成大坑 — goyalshaliniuk · 2026-09-27