UCLA 论文为 KV Cache 淘汰策略建立数学基础
burkov · x · 2026-09-03
UCLA 的新论文针对 LLM 推理中广泛存在但缺乏理论支撑的做法:生成时维护 KV cache,长输入下为省显存用手写规则删除部分条目,却说不清引入多大误差。
论文的两个核心贡献:
- 证明选择最优保留条目在计算上是困难问题(NP-hard 性质)
- 将注意力重写为期望值形式,把缓存淘汰转化为「用更少存储条目估计该期望值」的统计问题
方法上不再一味保留高分条目,而是按估计重要性对条目采样,并在后续生成中用重要性采样这一标准统计方法修正被删条目带来的注意力计算偏差,为缓存淘汰引入明确的误差刻画框架。
所属事件:新论文为 KV Cache 淘汰策略建立概率理论基础(3 条相关)→
「Infra」频道最新
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22
- Engram:本地加密记忆库统一各 AI 工具的 agent 记忆 — Acceptable_Leg3950 · 2026-09-22
- DigitalOcean Managed Agents 公测:闲置暂停、按秒计费 — damianplayer · 2026-09-22
- Subconscious 获 510 万美元融资,专做长程 Agent 推理平台 — CShorten30 · 2026-09-22
- Nscale 拟赴美上市估值 350 亿美元,Clegg 或获利 4000 万 — nordicinst · 2026-09-22
- NVIDIA 送出 DGX Spark 首晒:1.2kg 小机身、128GB 统一内存可本地跑 200B 模型 — kimmonismus · 2026-09-22