新论文:动量记忆调度可在 Transformer overtraining 轴上 outscales AdamW

_katieeverett · x · 2026-09-10

Katie Everett 与 Shikai Qiu 的新论文表明,优化器的动量记忆调度(如 ADANA)能在 overtraining 轴上持续超越 AdamW——这对过度训练已成为主流的当下有实际意义。线程依次给出定义(token 乘数、outscaling)与实验:51M–253M 模型上 ADANA 随 OT 增大拉开优势,Muon 优势恒定,SOAP 或在最高 OT 下进一步提升。

所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →