Princeton等研究:最优缩放规则随设置变,优化器排名会因batch size翻转
xingyudang · x · 2026-10-10
Princeton 的 Xingyu Dang、Stanford 的 Kaiyue Wen 与 UCSD 的 Sadhika Malladi 发布新论文与交互式博客,系统研究 batch size 缩放规则与优化器选择,核心结论:
- 缩放规则不普适:不同理论对同一优化器推荐不同的学习率缩放规则;作者用 Muon 测试数百条缩放规则(覆盖以往主流方案),发现最优规则取决于任务与目标 batch size。
- 优化器排名会翻转:在 modded-nanogpt track-3 上对 Adam、Lion、Muon、SOAP、Shampoo 逐个 batch size 重新调参后,排名随 batch size 变化——128K tokens/update 时 MuonH 胜过 ShampooH,2M 时 ShampooH 领先。
- 提出 CNR(curvature-to-noise ratio):SignSGD 玩具模型中,曲率相对噪声更高时学习率随 batch size 增长更快,从约 sqrt 趋向线性;不同方向需要不同缩放规则。
- 小 batch 下 SGD 也可能赢 Newton:Newton 能更快消除初始化误差但曲率校正会放大梯度噪声,在带噪二次问题上即使学习率与动量均最优,SGD 仍可在小 batch 胜出、Newton 在大 batch 胜出。
- 方向感知可补救:LM 预训练中,只对矩阵最尖锐的 0.001% 方向保留小 batch 更新,即可消除多达 59.5% 的缩放误差。
作者提供了交互式博客,可调整 batch size 观察优化器排名翻转,并自建缩放规则检验跨任务迁移性。