新研究:用代数分解理论预判 Transformer 长度泛化能力
tokenbender · x · 2026-08-16
这是一篇关于 Transformer 长度泛化能力的研究论文。现有模型在比训练序列更长的输入上表现不一致,但缺乏判断其能否正确泛化的精确方法。该论文建立了首个完整表征,界定了 Transformer 在哪些正则语言上能进行长度泛化,并提供了一种在语言句法幺群规模上运行时间为多项式的决策算法。研究发现,经典的 Krohn-Rhodes 分解理论不适用于此,因为 C-RASP(表达 Transformer 长度泛化的形式主义)的基本构建块(如无界计数)在有限半群中不可表达。
「研究」频道最新
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24
- Google 自动化科研系统发现 66 个生物标志物 — imjustnewatai · 2026-08-24