研究:Transformer 训练越久越难外推长序列,weight decay 加剧退化

andre_t_martins · x · 2026-10-08

Sardine Lab 的 Pavlo Vasylenko 等人发布新研究,探讨神经模型为何难以泛化到更长序列。

这对需要处理变长输入的场景(如长上下文推理)有直接参考价值:正则化项的选择不只是影响泛化,还会影响长度外推这一特定能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →