Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选

jiqizhixin · x · 2026-09-27

推理模型动辄生成数千 token,KV 随序列线性增长,对长推理服务而言 KV Cache 很快成为真正的系统瓶颈。标准解法是 KV cache eviction:设固定预算,持续判断哪些历史 KVs 值得保留、其余删除。多年来方法都在追逐更好的重要性信号——累积历史注意力、关注近期 query、追踪冗余、用 value 幅值或 key 统计量。

Salesforce AI Research 与 UIUC 从一个近乎「反算法」的问题出发:这些精心设计的筛选信号本身是不是问题?

他们提出 Random Attention:不做任何重要性判断,直接随机驱逐,完全省掉昂贵的打分环节。研究显示其效果出人意料地好(原帖截断,结论细节需见原文)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →