论文:语言模型可自控注意力,长上下文读取量省 52%
rohanpaul_ai · x · 2026-09-05
arXiv 论文《Language Models Can Control Their Own Attention》(Namgyu Ho 等)提出 Declarative Attention(DA):语言模型的大部分注意力只集中在少数上下文片段,却每次都要扫全 KV cache。DA 让模型在思维链中自行声明注意力需求,把生成划分为三种模式:
- <global>:读全上下文
- <focus>:只读某个特定区域
- <local>:只看近期输出
推理引擎像解析工具调用一样解析这些声明,跳过大部分 KV cache 读取,无需外部 proxy scorer(传统方法每步仍需 O(N) 开销)。
在 15 个长上下文任务的零样本评测中:
- Gemma-4-31B:注意力 token 减少 52.0%,精度仅降 1.27pp
- Qwen-3.6-27B:减少 31.1%,精度降 2.75pp
精度损失随模型规模增大而缩小,作者认为 DA 开辟了稀疏 attention 的新维度,配合训练方法还有更大潜力。
所属事件:Google 论文提出声明式注意力,推理开销降 52%(2 条相关)→
「Infra」频道最新
- 微软发布 Project Zenith:64GB 统一内存开发者设备的开箱即编码 Windows — luisdans · 2026-09-05
- 随 Hybrid Compute on Mac 发布,自研本地推理引擎与 PII 分类模型开源 — andrewgwils · 2026-09-05
- Tesla 用反应注塑工艺砍掉喷涂车间,工厂面积可减约 50% — elonmusk · 2026-09-05
- AMD 发布 Threadripper Halo Station:96 核 CPU 加 MI350P 共 288GB HBM3E — Aroochacha · 2026-09-05
- Extropic 发布 Z1T 模型家族:稀疏概率硬件能效最高达 GPU 140 倍 — afurgs · 2026-09-05
- Google 为何牵手 Parallel:独立 AI 网页索引成新赛道? — Genzinvestor16180339 · 2026-09-05