ADANA 动量调度优化器在过训练轴上改写 scaling 指数
Katie Everett 与 Shikai Qiu 发布新论文(arXiv 2609.04577),系统研究优化器在过度训练(overtraining)轴上的缩放规律。核心发现是:优化器的动量记忆调度不仅能改善常数因子,还能真正改变 scaling 指数,即「outscales」AdamW;在最高过训练量下,ADANA 相对 AdamW 的 token 乘数近乎翻倍。
已确认
- 作者提出 ADANA 类方法(源自 Ferbach et al. 2025/2026 的 DANA/ADANA 系列):动量窗口随训练步数线性增长,在 power-law random features 设置下可改善部分 regime 的表现
- 理论依据:DANA 基于幂律随机特征的理论预测,对数时间记忆能以 2-κ 的斜率超越固定记忆,κ 为数据分布属性,作者测得语言数据 κ≈0.85;由此对数时间记忆理论上应以 O(t) 步达到固定记忆 O(t^1.15) 步的损失,实验中 AdamW 配合相应调度后等效过训练量大致遵循该 1.15 斜率
- 核心实验:51M–253M 参数 Transformer、固定 batch(256×2048),随 overtraining 因子增大,ADANA 持续 outscales AdamW;矩阵预条件优化器在小 OT 区间占优——Muon 优势大致恒定、SOAP 更优,ADANA 超越 Muon、逼近 SOAP
- 附加发现:按 LR 衰减时间尺度缩短记忆窗口的 momentum cooldown 规则在最高过训练量下使 ADANA 相对 AdamW 的 token 倍数近乎翻倍;对数时间 weight decay(Ferbach et al. 2026)对 AdamW、ADANA、SOAP 有帮助,但在高过训练下伤害 Muon;仅按视界对 momentum 常数调优能提升基线,但无法解释 ADANA 的优势
- 作者在线程中给出 outscaling 与 token 乘数的定义:固定模型规模下达到相同 loss 时基线优化器与对比优化器所需 token 数之比,2x 即基线需两倍 token;若该乘数沿 overtraining 轴增加即为 outscales
尚未确认(作者自述局限)
- 模型规模较小(51M–253M),更大规模下的结论待验证
- batch 固定为 256×2048,batch 增大时 ADANA 可能更早失去效率优势
- 部分对比点需要对基线进行外推
为什么重要
- 过度训练(用小模型吃更多 token)已成为当下主流做法,若优化器选择能改变该轴上的缩放指数而非仅常数因子,意味着实际训练中有可观收益
- 这是把优化器研究从「同指数下快一点」推进到「指数本身不同」的证据,尽管规模与 batch 条件仍有限
2026-09-10 ~ 2026-09-10 · 13 条相关
一手来源
- 新论文:优化器记忆调度可在过训练维度真正改变 scaling 指数 — _katieeverett ·
- 51M–253M 模型实测:ADANA 随 overtraining 拉开对 AdamW 优势 — _katieeverett ·
- ADANA 论文线程续篇:优化器指数级优势的补充实验与局限说明 — _katieeverett ·
- 【源头】新论文:优化器记忆调度可在过训练维度真正改变 scaling 指数 — _katieeverett · 2026-09-10
- 新论文:动量记忆调度可在 Transformer overtraining 轴上 outscales AdamW — _katieeverett · 2026-09-10
- 【源头】51M–253M 模型实测:ADANA 随 overtraining 拉开对 AdamW 优势 — _katieeverett · 2026-09-10
- token 乘数定义:2x 即基线需两倍 token 达同损 — _katieeverett · 2026-09-10
- 定义 outscaling:token 乘数沿 overtraining 轴增加 — _katieeverett · 2026-09-10
- DANA/ADANA 优化器线程:动量窗口随训练线性增长改善 scaling — _katieeverett · 2026-09-10
- ADANA 论文:仅按视界调 momentum 常数无法解释其对 AdamW 的优势 — _katieeverett · 2026-09-10
- ADANA 论文:对数时间 weight decay 助 AdamW/SOAP 却伤 Muon — _katieeverett · 2026-09-10
- ADANA 论文:momentum cooldown 规则令 token 倍数相对 AdamW 近乎翻倍 — _katieeverett · 2026-09-10
- ADANA 论文:DANA 理论预测对数时间记忆以 2-κ 斜率跑赢固定记忆 — _katieeverett · 2026-09-10
- ADANA 论文线程:momentum cooldown + 对数时间 wd 令 AdamW 等效 OT 呈 1.15 斜率 — _katieeverett · 2026-09-10
- 【源头】ADANA 论文线程续篇:优化器指数级优势的补充实验与局限说明 — _katieeverett · 2026-09-10
- 优化器也能改变缩放指数:ADANA 在过度训练轴上超越 Muon 逼近 SOAP — _katieeverett · 2026-09-10