小规模复现大模型训练不稳定:学习率敏感度研究

stochasticchasm · x · 2026-08-28

推文讨论了 arXiv 论文《Small-scale proxies for large-scale Transformer training instabilities》(Wortsman 等人)。论文核心:大模型训练中出现的训练不稳定现象(如注意力层 logits 增长、输出 logits 与对数概率发散)难以在大规模上复现研究,作者证明在小模型上使用高学习率也能复现这些不稳定,且大规模场景下常用的缓解措施同样有效;论文还系统研究了 warm-up、weight decay、注意力 logit 软上限等干预对最终 loss 学习率敏感度的影响。讨论中还提到 batch size warmup 似乎没有效果,且结果在不同架构上可能不通用。

所属事件:GDN 架构图与大模型训练稳定性研究引热议(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →