优化器也能改变缩放指数:ADANA 在过度训练轴上超越 Muon 逼近 SOAP
_katieeverett · x · 2026-09-10
arXiv 2609.04577(Katie Everett 等)研究优化器在过度训练(overtraining)轴上的缩放规律,对比 AdamW、Muon、SOAP 与动量调度方法 ADANA:模型从 51M 到 253M 参数,过度训练因子 1x 到 256x,每个设置都扫了基准学习率。
主要发现:
- 最优学习率调度可能随训练时程反转;最优权重衰减系数约按 √(OT) 缩放;更长训练时程偏好更长的固定记忆。
- ADANA 相对 AdamW 的缩放优势在对 AdamW 每个时程单独调优后仍然保持;配合对数时间权重衰减与动量冷却,其指数优势接近 DANA 理论在幂律随机特征上的预测。
- Muon 和 SOAP 在大部分测量范围内只带来常数级 token 效率提升(SOAP 在最高过度训练因子下可能进一步拉开);ADANA 起步落后于两者,但随训练变长逐渐缩小差距,在最高 OT 因子下超过 Muon、追平 SOAP。
作者认为这是首个让她相信优化器真的能改变 Transformer 缩放指数(而非只改善常数因子)的工作。
所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→
「模型」频道最新
- OpenAI 称 Astra 达 Critical 网络安全阈值,且比上代更难监控 — theguywhobuilds · 2026-09-11
- TestingCatalog 日报改版:周二至周六新增邮件订阅 — testingcatalog · 2026-09-11
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11