Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache
Vishesh Tripathi · hf · 2026-09-15
- Grouped Value Attention (GVA) 提出一种新的 KV Cache 压缩思路:不再完整存储每个 token 的 Key 和 Value,而是只存分组后的 Value,再通过一个可学习的线性映射按需重建 Key。
- 核心逻辑:Key 在推理时可以由 Value 组的紧凑表示线性恢复,因此持久化缓存体积显著缩小。
- 实测可达到接近 GQA(Grouped Query Attention) 的精度,同时缓存占用更小,为长上下文推理的显存优化提供新选项。
「Infra」频道最新
- 单卡 5090 跑 Qwen3.8-27B:SGLang 全参数调优只换来 82k 上下文 — ni1by2thetrue · 2026-09-15
- 把 4 块 MCU 开发板搬上网:AI 写完固件即时上真芯片测试 — SelfishlyWandering · 2026-09-15
- jinfer 开源:纯 JVM 实现 AI 推理引擎,CPU 性能比肩 llama.cpp — mukel90 · 2026-09-15
- Wan 2.2 显存实测:砍帧数不降 OOM,降分辨率一次省 10GB — Realistic-Fennel-190 · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- 单周 500 万亿 token 将至,引用图示 LLM 用量持续飙升 — gajesh · 2026-09-15