Google 论文提出声明式注意力,推理开销降 52%

Google 部署团队的 arXiv 论文《Language Models Can Control Their Own Attention》(Namgyu Ho 等)提出 Declarative Attention 机制:不再让 LLM 为每个 token 重读全部上下文,而是由模型自己声明需要读取哪些部分,推理引擎据此跳过其余内容。该方法可将长上下文的注意力读取量降低约 52%,显著降低推理开销。

2026-09-05 ~ 2026-09-05 · 2 条相关