新论文提出 ANNA 注意力机制,亚二次复杂度不损表达能力
kfountou · x · 2026-09-21
哥伦比亚大学等机构研究者在 arXiv 发布论文《Fast attention mechanisms: a tale of parallelism》,提出近似最近邻注意力机制 ANNA(Approximate Nearest Neighbor Attention),将注意力计算从二次复杂度降到亚二次复杂度。
关键结论:
- ANNA-transformer 保留了标准注意力已证明的表达能力,仍能模拟 MPC(Massively Parallel Computation)算法;
- 能以近最优深度解决 Match2、k-hop 等关键推理任务;
- 利用 MPC 框架进一步证明:常数深度的 ANNA-transformer 可以模拟常数深度的低秩 transformer,为一大类高效注意力近似提供了统一的分析方式。
作者包括 Jingwen Liu、Hantao Yu、Clayton Sanford、Alexandr Andoni、Daniel Hsu。
「研究」频道最新
- HEAL:多模态幻觉源于「协同头」信息分布漂移,注入校准因子可缓解 — SUAT-SZ · 2026-09-21
- 训练自适应卷积稀疏编码:稀疏系数可微化,扰动下鲁棒性大增 — SUAT-SZ · 2026-09-21
- Cal-OPD:只保留一半师生差异信号,在线蒸馏数学推理更优 — nanjinguniv · 2026-09-21
- 测试时协作新研究:5 个 Claude 智能体团队媲美 33 个独立智能体 — DimitrisPapail · 2026-09-21
- Schmidhuber 贺 Jev 发布:1991 年我就发过同类「自适应置信度」系统 — multiply_matrix · 2026-09-21
- Tom Yeh 发布 Kimi 3 研讨会录像,Nathan Lambert 做嘉宾 — ProfTomYeh · 2026-09-21