Google DeepMind 论文 Declarative Attention:让模型自己声明读哪段 KV cache
omarsar0 · x · 2026-09-04
Google DeepMind 及合作者发布论文 Declarative Attention,直击长上下文推理的核心浪费:模型每生成一个 token 都要重读全部 KV cache,即使实际只关注其中一小部分——100 万 token 对话中问一个细节,全局注意力层每步都要重读全部缓存。
- 现有方案的局限:常规做法是先用廉价代理分数猜出相关 token,但每步开销仍是 O(N)。
- 新思路:让模型在思维链中直接「声明」自己要看哪里,推理引擎像解析工具调用一样解析这些声明,跳过大部分缓存读取。
- 三种生成模式:global(读全部上下文)、focus(只读某个特定区域)、local(只读近期输出)。
- 效果:在现成权重、零训练的条件下,15 个长上下文任务上大幅减少实际需要关注的 token 数。
所属事件:Declarative Attention:让语言模型自主声明读哪段 KV cache(5 条相关)→
「Infra」频道最新
- 网友自组双 AMD R9700 本地推理机,征集调优经验 — Current-Ticket4214 · 2026-09-23
- OpenRouter 批量 API 覆盖 71 款模型,价格自动择优路由 — jeff_weinstein · 2026-09-23
- 工程师求全离线文档问答方案:Ollama+Open WebUI+RAG 组合获荐 — betobagio · 2026-09-23
- 评论者批 Googlebook 硬件无野心:Intel NPU 放弃消费级市场 — julianharris · 2026-09-23
- vLLM 支持 Google DiffusionGemma:块扩散 MoE 吞吐约提升 1.9 倍 — vllm_project · 2026-09-23
- Kimi K3 等开源大模型或严重欠训练,数据 scaling 远未见顶 — zeeshanp_ · 2026-09-23