作者重新推荐 2020 年 LaProp:先归一再累积动量,比 Adam 更稳

Gradientdinner · x · 2026-08-25

刘子吟等人重新介绍了他们 2020 年提出的优化器 LaProp(arXiv:2002.04839)。核心想法是质疑 Adam 中动量累积的「正确性」:LaProp 将动量累积放在归一化之后进行,使训练在各种参数范围下都更稳定。

论文指出了一个此前未被认识的 Adam 类优化器问题——动量与自适应性之间不必要的耦合会导致失配时的不稳定与发散。解耦后在超参数上更灵活,可在带符号梯度方法与自适应梯度方法之间直接插值。实验显示 LaProp 在多种任务上比 Adam 持续更快的速度和更好的稳定性,作者认为它今天或许仍有实用价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →