递归单元为何擅长时间泛化:表达能力不等于梯度下降能找到
mike64_t · x · 2026-09-14
作者 argued 传统循环单元(RNN/GRU)在某些合成状态追踪任务上具有「好得离谱」的归纳偏置:它们往往能直接表达任务所需的计算,并因 teacher forcing 而轻松学到该精确形式,而 Transformer 被迫构造定制化近似。
关键观点:不要仅凭「某架构在长度泛化上无法学会某任务」就断言它不具备该计算的表达能力——「能表达什么」与「梯度下降能找到什么」是两回事,这在玩具任务常见的尖锐损失地形中尤其相关。实验性退化不能推出表达能力的缺失。
「研究」频道最新
- 论文剖析 async/await:各语言设计其实大相径庭 — yoavgo · 2026-09-14
- Grok 生成群论定理证明,声称攻克 Boone-Higman 未决情形 — Sauers_ · 2026-09-14
- PDE 学者谈 OpenAI 构造 Navier-Stokes 爆破证明:人类理解从此滞后于证明 — soumitrashukla9 · 2026-09-14
- NASA与IBM发布月面测绘AI,精准识别SpaceX火箭撞出的新陨石坑 — imjustnewatai · 2026-09-14
- SkySynth发布:形式化证明+测试共演化,合成的KV存储比Redis快2.3倍 — CShorten30 · 2026-09-14
- Yoav Goldberg 澄清:不是过拟合测试集,是为任务大规模训练 — yoavgo · 2026-09-14