Google 论文:让模型自选上下文,注意力开销降 52%
rohanpaul_ai · x · 2026-09-05
Google 一篇部署论文提出 Declarative Attention:不再让 LLM 为每个 token 重读全部上下文,而是由模型自己声明需要读哪部分,推理引擎跳过其余内容,无需额外 scorer 先扫全上下文。在 15 个长上下文任务零样本评测中,Gemma-4-31B 的注意力开销降 52.0%,Qwen-3.6-27B 降 31.1%,精度分别只掉 1.27 和 2.75 个百分点;模型越大权衡越好,配合训练还有提升空间。
所属事件:Google 论文提出声明式注意力,推理开销降 52%(2 条相关)→
「Infra」频道最新
- Tesla 用反应注塑工艺砍掉喷涂车间,工厂面积可减约 50% — elonmusk · 2026-09-05
- AMD 发布 Threadripper Halo Station:96 核 CPU 加 MI350P 共 288GB HBM3E — Aroochacha · 2026-09-05
- Extropic 发布 Z1T 模型家族:稀疏概率硬件能效最高达 GPU 140 倍 — afurgs · 2026-09-05
- Google 为何牵手 Parallel:独立 AI 网页索引成新赛道? — Genzinvestor16180339 · 2026-09-05
- PwC 报告:数据中心每投 1 美元建设,约锁定 12 美元后续设备开支 — rohanpaul_ai · 2026-09-05
- 几乎全线 LLM 昨天宕机,Google News 25 页却无一头条 — Reddit_wander01 · 2026-09-05