递归单元为何擅长时间泛化:表达能力不等于梯度下降能找到

mike64_t · x · 2026-09-14

作者 argued 传统循环单元(RNN/GRU)在某些合成状态追踪任务上具有「好得离谱」的归纳偏置:它们往往能直接表达任务所需的计算,并因 teacher forcing 而轻松学到该精确形式,而 Transformer 被迫构造定制化近似。

关键观点:不要仅凭「某架构在长度泛化上无法学会某任务」就断言它不具备该计算的表达能力——「能表达什么」与「梯度下降能找到什么」是两回事,这在玩具任务常见的尖锐损失地形中尤其相关。实验性退化不能推出表达能力的缺失。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →