论文:语言模型可自控注意力,长上下文读取量省 52%

rohanpaul_ai · x · 2026-09-05

arXiv 论文《Language Models Can Control Their Own Attention》(Namgyu Ho 等)提出 Declarative Attention(DA):语言模型的大部分注意力只集中在少数上下文片段,却每次都要扫全 KV cache。DA 让模型在思维链中自行声明注意力需求,把生成划分为三种模式:

推理引擎像解析工具调用一样解析这些声明,跳过大部分 KV cache 读取,无需外部 proxy scorer(传统方法每步仍需 O(N) 开销)。

在 15 个长上下文任务的零样本评测中:

精度损失随模型规模增大而缩小,作者认为 DA 开辟了稀疏 attention 的新维度,配合训练方法还有更大潜力。

所属事件:Google 论文提出声明式注意力,推理开销降 52%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →