新论文:优化器记忆调度可在过训练维度真正改变 scaling 指数
_katieeverett · x · 2026-09-10
Katie Everett 与 ShikaiQiu 的新论文显示,优化器的记忆调度(momentum schedule)不仅改善常数因子,还能在 Transformers 的过训练(overtraining, OT)轴上「跑赢」AdamW 的 scaling 指数——这是作者首次被说服优化器真能改变指数而不只是理论。
要点:
- ADANA 优势:单纯按 horizon 调 momentum 常数无法解释 ADANA 相对 AdamW 的优势;更长训练视界偏好更长记忆配合更小学习率。
- 对数时间 weight decay:有助 AdamW/ADANA/SOAP,但在高 OT 下伤害 Muon——最佳处理取决于优化器与视界的组合。
- Momentum cooldown 规则:按 LR 衰减时间尺度在训练末期缩短记忆窗口,ADANA 相对 AdamW 的 token 倍数在最高 OT 下近乎翻倍。
- 理论对应:DANA 理论预测对数时间记忆以 2-κ 斜率跑赢固定记忆(语言数据 κ≈0.85);组合 cooldown 与对数时间 wd 后,AdamW 所需等效 OT 约呈 1.15 斜率。
- 局限:模型较小(51M–253M),固定 batch 256×2048,batch 增大时 ADANA 优势可能缩小;部分点需外推基线拟合。
结论:优化器研究值得被当作物料层面的 scaling 杠杆重新审视,而非只是常数优化。
所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→
「研究」频道最新
- 哈工大提出 EASE:证据锚定空间注意力,让多模态 RLVR 答对也看对地方 — jiqizhixin · 2026-09-11
- P=NP 到底难在哪:排课表与电路布线才是真正的硬骨头 — thesaraharminta · 2026-09-11
- MutexaGPT:LLM翻译直觉,分子动力学筛选酶突变,命中率40% — bravo_abad · 2026-09-11
- 单作者ECCV 2026论文:让卷帘快门失真修正实用化 — ducha_aiki · 2026-09-11
- MetroLLM-Bench:小模型微调后可在交通自助机任务上比肩大模型 — continker · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11