UCLA 论文为 KV Cache 淘汰策略建立数学基础

burkov · x · 2026-09-03

UCLA 的新论文针对 LLM 推理中广泛存在但缺乏理论支撑的做法:生成时维护 KV cache,长输入下为省显存用手写规则删除部分条目,却说不清引入多大误差。

论文的两个核心贡献:

方法上不再一味保留高分条目,而是按估计重要性对条目采样,并在后续生成中用重要性采样这一标准统计方法修正被删条目带来的注意力计算偏差,为缓存淘汰引入明确的误差刻画框架。

所属事件:新论文为 KV Cache 淘汰策略建立概率理论基础(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →