Google 论文:让模型自选上下文,注意力开销降 52%

rohanpaul_ai · x · 2026-09-05

Google 一篇部署论文提出 Declarative Attention:不再让 LLM 为每个 token 重读全部上下文,而是由模型自己声明需要读哪部分,推理引擎跳过其余内容,无需额外 scorer 先扫全上下文。在 15 个长上下文任务零样本评测中,Gemma-4-31B 的注意力开销降 52.0%,Qwen-3.6-27B 降 31.1%,精度分别只掉 1.27 和 2.75 个百分点;模型越大权衡越好,配合训练还有提升空间。

所属事件:Google 论文提出声明式注意力,推理开销降 52%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →