让模型自己声明注意力:零样本省下 31-52% KV cache 读取
chaumian · x · 2026-09-04
arXiv 论文《Language Models Can Control Their Own Attention》提出 Declarative Attention(DA)协议,解决长上下文推理中全局注意力必须扫描全部 KV cache 的开销问题。
- 核心思路:不再用外部代理分数挑选 token(每步仍 O(N)),而是让模型在思维链中自己「声明」需要关注哪里,分为三种模式:<global>(全上下文)、<focus>(特定区域)、<local>(仅近期输出)
- 推理引擎像解析工具调用一样解析这些声明,跳过大部分 KV cache 读取
- 零样本结果:在 15 个长上下文任务上,现成模型(Gemma-4-31B、Qwen-3.6-27B)解码期被注意 token 总量分别减少 52.0% 和 31.1%,精度损失仅 1.27pp 和 2.75pp,且随模型规模增大而缩小
- 为稀疏注意力开辟新轴,训练式方法还有进一步提升空间
所属事件:KAIST提出Declarative Attention零样本省三至五成KV读取(3 条相关)→
「研究」频道最新
- 小规模 RL 玩家:每晚几百条 rollout 就够,「也许不用 35B 了」 — cephaloform · 2026-09-04
- 每晚只用 400-600 次 rollout 做 RL,作者称能「感觉到」模型变强 — cephaloform · 2026-09-04
- Baseten 推出 Base Labs 研究实验室,全部实验结果无条件公开 — eigenron · 2026-09-04
- 研究者:模型与优化器超参可由宽度和 token 数推出 — dlwh · 2026-09-04
- OpenAI 官方账号连发素数证明仓库,被指为 Astra 铺路 — NoFaithlessness951 · 2026-09-04
- Google 用 AI 重建果蝇全脑,绘制超 16.6 万神经元图谱 — burny_tech · 2026-09-04