Declarative Attention 协议:让模型自己声明注意区域,解码省 52% KV 读取
eigenlaplace · reddit · 2026-09-05
arXiv 新论文提出 Declarative Attention(DA):与其用外部代理分数预筛 token,不如让模型在思维链里自己声明它需要关注上下文的哪个部分。
- 动机:模型注意力其实集中在少部分上下文,但全局注意力层每步都要扫描整个 KV cache;百万 token 对话下代价巨大。现有 proxy 评分方法仍是每步 O(N)。
- 做法:把生成划分为三种模式——<global>(全上下文)、<focus>(特定区域)、<local>(仅近期输出),推理引擎像解析工具调用一样解析这些声明,跳过大部分 KV cache 读取。
- 结果:在 15 个长上下文任务上零样本评估,现成模型(Gemma-4-31B、Qwen-3.6-27B)解码期总注意力 token 分别减少 52.0% 和 31.1%,精度仅下降 1.27pp / 2.75pp,且随模型规模增大而收窄。
作者认为这开辟了稀疏注意力的新轴,配合训练式方法还有更大潜力。
所属事件:新论文让模型自控注意力,KV 读取省 52%(3 条相关)→
「Infra」频道最新
- 腾讯混元 Hy4 预览:770B 总参 49B 激活,原生 1M 上下文 Apache 2.0 — aftahi_ai · 2026-09-05
- Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价 — ChopSticksPlease · 2026-09-05
- Speechify CEO 谈自建数据中心、被 ElevenLabs 反超与千万美元人才战 — 20VC · 2026-09-05
- 他把本地 LLM 当 3D 打印机用:一年自写 12 个游戏、29 个游戏 Mod — Quebber · 2026-09-05
- 算力变现效率差 5 倍:智谱每兆瓦仅 800-1000 万美元,Anthropic/OpenAI 达 4000-5000 万 — zephyr_z9 · 2026-09-05
- 用户抱怨 AWS 每月自动扣 0.1 美元且用途不明 — kylegawley · 2026-09-05