研究:Transformer 训练越久越难外推长序列,weight decay 加剧退化
andre_t_martins · x · 2026-10-08
Sardine Lab 的 Pavlo Vasylenko 等人发布新研究,探讨神经模型为何难以泛化到更长序列。
- 结论是不只是架构问题:Transformer 会在训练过程中逐渐丧失外推到更长序列的能力
- weight decay 会加速这种外推能力退化
- 而位置恰当的 dropout 反而能改善外推表现
这对需要处理变长输入的场景(如长上下文推理)有直接参考价值:正则化项的选择不只是影响泛化,还会影响长度外推这一特定能力。
「研究」频道最新
- OpenAI 未审稿预印本称矩阵乘法指数降至 2.25,创 47 年最大降幅 — BorisMPower · 2026-10-08
- Google 新联邦学习设计把服务器访问策略写入公开日志 — Crescitaly · 2026-10-08
- AI2 Bolmo 分词器消除全球南方文字的「token 税」 — Kyle_L_Wiggers · 2026-10-08
- TEMPO 给 VLA 补上时间上下文,机器人接瓶成功率从 44% 升到 74% — _krishna_murthy · 2026-10-08
- CheckerBench:300 道任务测出编码 Agent 写静态检查器最好仅 45% 通过率 — humanlaya-data-lab · 2026-10-08
- Gary Marcus 炮轰 OpenAI 数学突破报告:换未发布模型、零细节,过不了同行评审 — Gary Marcus · 2026-10-08