Google 论文提出声明式注意力,推理开销降 52%
Google 部署团队的 arXiv 论文《Language Models Can Control Their Own Attention》(Namgyu Ho 等)提出 Declarative Attention 机制:不再让 LLM 为每个 token 重读全部上下文,而是由模型自己声明需要读取哪些部分,推理引擎据此跳过其余内容。该方法可将长上下文的注意力读取量降低约 52%,显著降低推理开销。
2026-09-05 ~ 2026-09-05 · 2 条相关
- Google 论文:让模型自选上下文,注意力开销降 52% — rohanpaul_ai · 2026-09-05
- 论文:语言模型可自控注意力,长上下文读取量省 52% — rohanpaul_ai · 2026-09-05