作者重新推荐 2020 年 LaProp:先归一再累积动量,比 Adam 更稳
Gradientdinner · x · 2026-08-25
刘子吟等人重新介绍了他们 2020 年提出的优化器 LaProp(arXiv:2002.04839)。核心想法是质疑 Adam 中动量累积的「正确性」:LaProp 将动量累积放在归一化之后进行,使训练在各种参数范围下都更稳定。
论文指出了一个此前未被认识的 Adam 类优化器问题——动量与自适应性之间不必要的耦合会导致失配时的不稳定与发散。解耦后在超参数上更灵活,可在带符号梯度方法与自适应梯度方法之间直接插值。实验显示 LaProp 在多种任务上比 Adam 持续更快的速度和更好的稳定性,作者认为它今天或许仍有实用价值。
「研究」频道最新
- GLiNER 2.5 发布:架构升级支持全文档长上下文提取 — huggingface · 2026-08-25
- 技术分析证实 stealth/ox-alpha 实为 Z.ai 的 GLM 模型 — PawelHuryn · 2026-08-25
- Nature Methods 发布 ProteinDPO 蛋白质生成模型 — BrianHie · 2026-08-25
- Thinking Machines 提出开放权重模型的安全路径 — luke_drago_ · 2026-08-25
- Headlong 实验持久化 Agent:指数退避与分层上下文 — lateinteraction · 2026-08-25
- CoRL 2026 机器人基础模型记忆研讨会征稿 — EricLengyel · 2026-08-25