新研究提出 KV Cache 驱逐的概率解释与校正方法
burny_tech · x · 2026-09-01
针对现有 KV Cache 驱逐方法多采用 top-k 启发式策略导致注意力扭曲的问题,新论文《A Probabilistic Interpretation of KV Cache Eviction》提出了基于概率的解释框架。
- 核心观点:将 KV 驱逐问题重构为期望估计问题,而非简单的启发式筛选。
- 方法:使用概率采样和重要性加权在解码期间校正缺失的 KV 条目。
- 结论:该方法提供了原则性的偏差-方差权衡,在相同压缩预算下性能具有竞争力,且在不同任务中更具鲁棒性。
「Infra」频道最新
- 欧盟再购 3.88 亿欧元 AI 超算,算力供不应求 — VraserX · 2026-09-02
- Token 压缩工具无效:研究称削减 38% 输出仅省 1.3% 账单 — JFPuget · 2026-09-02
- AI 推理优化厂商 Wafer AI 获 4000 万美元 A 轮融资 — ycombinator · 2026-09-02
- David Manheim 算账:Hugging Face 袭击成本并非高不可攀 — davidmanheim · 2026-09-02
- RX 9070 XT 上 ComfyUI 突然变慢 3-5 倍,疑为 ROCm 驱动驱逐显存 — bosox62 · 2026-09-02
- Token 翻倍速度是 AI 的摩尔定律,作者估算 1-2 年内触及 GDP 1% — robleclerc · 2026-09-02