RestoreKV:大幅修复激进KV缓存压缩造成的性能崩塌
Changwoo Baek · hf · 2026-08-05
在长上下文处理中,激进的 KV 缓存压缩往往会导致模型性能急剧下降。RestoreKV 提出了一种学习型恢复机制,在不增加总缓存预算的前提下,有效弥补了信息丢失。
- 核心机制:在上下文预填充阶段,利用少量恢复 token 对完整 KV 缓存进行一次 LoRA 适配处理,生成紧凑的上下文恢复缓存。
- 高效训练:通过冻结全缓存模型进行参数高效的自蒸馏训练,仅优化 0.4% 的参数,且无需特定任务微调。
- 实验结果:在 Qwen3-4B 模型上,改进了 60 种配对设置中的 59 种。在 5% 极限预算下,将 KVzip 在 RULER-4K 上的得分从 38.2 提升至 73.2;在 16 倍压缩率下仍能达到 86.4 的准确率。
「Infra」频道最新
- 华尔街预计 AI 基建狂飙:OpenAI 明年单季资本支出或超 180 亿美元 — PTrubey · 2026-08-05
- 4090 实测 MiniMax H3:Sage Attention 节点让生成时间暴降 — thegr8anand · 2026-08-05
- 3090 升级抉择:24G 显存够用还是直上 32G? — gtech02 · 2026-08-05
- 斯坦福 Hazy Research:AI Agent 正在让 CUDA 抽象层退役 — sumitdotml · 2026-08-05
- AI智能体自主编写Triton内核,打破 NanoGPT 训练速度记录 — cong_ml · 2026-08-05
- 英伟达股价大涨,创两个月来新高 — Polymarket · 2026-08-05