ADANA 论文:momentum cooldown 规则令 token 倍数相对 AdamW 近乎翻倍

_katieeverett · x · 2026-09-10

线程第三问:能否在训练末期缩短 ADANA 的记忆窗口来提升效果?作者提出按 LR 衰减时间尺度缩短窗口的 momentum cooldown 规则,在最高过训练量下使 ADANA 相对 AdamW 的 token 倍数近乎翻倍。

所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →