NeurIPS 2025 论文:稀疏注意力何时涌现遵循幂律,数据重复可大幅加速
scychan_brains · x · 2026-09-02
Stephanie Chan 等人的 NeurIPS 2025 论文《The emergence of sparse attention》研究 Transformer 中稀疏注意力模式在训练过程中的涌现机制。
- 通过玩具模型的理论分析 + 小型 Transformer 在线性回归变体任务上的实证观察,揭示了驱动稀疏注意力涌现的机制。
- 发现涌现时机遵循幂律,取决于任务结构、架构与优化器选择。
- 数据重复可以大幅加速涌现。
- 结果在 in-context 关联召回任务上得到验证,为理解数据分布与模型设计如何影响涌现的学习动力学提供了有理论依据的框架。
「研究」频道最新
- The World Labs 发布 Atlas:支持像素级相机控制 — Scobleizer · 2026-09-02
- 4DAnyone 上线 Gradio:5090 显存优化至 32G 以下 — _akhaliq · 2026-09-02
- Muse Voice Transcribe:自适应延迟平衡速度与精度 — AIatMeta · 2026-09-02
- Speculative PTC: 将工具调用与代码生成并行以提速 — a1zhang · 2026-09-02
- 不用 LLM 拍脑袋:用贝叶斯层计算 PR 缺陷概率 — Sakuraaa_29 · 2026-09-02
- 高斯过程与RKHS专著发布,建立统一视角 — RichmanRonald · 2026-09-02