MIT教授:代数结构可预测Transformer长度泛化能力
ProfBuehlerMIT · x · 2026-08-15
MIT教授ProfBuehlerMIT分享了一项有趣的研究,该研究使用Tilson的范畴作为代数工具,揭示了Transformer在结构化序列任务上何时以及为何能进行长度泛化。作者表明,对于某些任务,Transformer学到的计算在序列变长时仍能工作;对于其他任务,它学到的计算在训练范围内有效,但在范围外失效。任务的代数结构可以预测这种差异。这有助于更系统地设计训练课程、学习方法和架构,以促进能够外推的计算。
「研究」频道最新
- 谷歌开源同态加密编译器 HEIR,可在加密数据上直接推理 — DynamicWebPaige · 2026-08-15
- 数学家用 AI 找到 30 年前猜想反例 — skdh · 2026-08-15
- 谷歌开源同态加密编译器,密文推理成为现实 — DynamicWebPaige · 2026-08-15
- 学术圈激辩:论文评审能否使用 AI 及其披露规范 — lpachter · 2026-08-15
- Claude 数日解决随机热力学开放问题 — lpachter · 2026-08-15
- GPU竞赛:紧凑Householder QR内核实现232倍加速 — petrusenko_max · 2026-08-15