让模型自己声明注意力:零样本省下 31-52% KV cache 读取

chaumian · x · 2026-09-04

arXiv 论文《Language Models Can Control Their Own Attention》提出 Declarative Attention(DA)协议,解决长上下文推理中全局注意力必须扫描全部 KV cache 的开销问题。

所属事件:KAIST提出Declarative Attention零样本省三至五成KV读取(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →