KAIST 新研究:语言模型可自主控制注意力,省下最多52%解码成本

KAIST 发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention(DA)协议:让语言模型在推理过程中自行声明相关上下文区域,从而跳过大部分 KV cache 读取。实验显示该方法在零样本条件下即可减少 31-52% 的 KV cache 读取量,解码成本最多降低 52%,同时大幅缩减实际需要关注的上下文范围。

2026-09-03 ~ 2026-09-04 · 3 条相关