KAIST 新研究:语言模型可自主控制注意力,省下最多52%解码成本
KAIST 发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention(DA)协议:让语言模型在推理过程中自行声明相关上下文区域,从而跳过大部分 KV cache 读取。实验显示该方法在零样本条件下即可减少 31-52% 的 KV cache 读取量,解码成本最多降低 52%,同时大幅缩减实际需要关注的上下文范围。
2026-09-03 ~ 2026-09-04 · 3 条相关
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03
- 让模型自己声明注意力:零样本省下 31-52% KV cache 读取 — chaumian · 2026-09-04
- 新论文:语言模型可自主控制注意力,解码成本降 52% — jm_alexia · 2026-09-04