训练中反复开优化器锦标赛,一周期侦察只需穷搜三成算力

Many Optimizers But Only One Training Path: Repeated Resampling for Adaptive Optimizer Selection

Ronald Richman, Mario V. Wüthrich

cs.LG

2026-08-19

ROR每隔三段让九个优化器从当前权重侦察一轮,赢家继续。四项任务上接近事后最优固定优化器,算力只需穷搜的24%到35%。

这篇在解决什么

训练网络前通常先拍板一个优化器,然后整段跑完。想把优化器当超参搜,就要把 Adam、Muon、Lion 这类候选各训一轮,只留赢家,其余全部扔掉。事后最优还不一定全程最优:前期快速下降和后期精修可能需要不同的更新规则。

ROR 把选择改成「一条还在长的训练轨迹上反复开短锦标赛」。目标是用远小于穷搜的算力,逼近那个事后才知道的赢家。切换课表会不会超过最好的固定选择,这篇没有做成正结果。

方法

锦标赛有两个时间尺度。侦察期 s 是每个候选从当前权重往前跑几轮;保留段 b 是赢家把这段轨迹真正推进多远,满足 1≤s≤b。每轮开始时复制当前权重 K 份,九个优化器按同一数据顺序各侦察 s 个 epoch,验证集最好的那个再继续 b−s 轮。如果整段把验证目标改进超过阈值 δ,这段成为新的 incumbent,即当前被接受的权重和优化器状态;否则本轮作废,训练直接停。

一轮的搜索成本是 b+(K−1)s 个 epoch-equivalent,把所有分支(含被丢掉的侦察)折成训练轮次。K=9、b=3 时,s=1 只要 11 个 epoch-equivalent,s=3 则要 27。穷搜的成本是九条固定跑各自停下来的 epoch 之和。

状态策略分两种:

不保留落选者的状态。那些状态是在被丢掉的权重上学出来的,接到赢家权重上等于移植;要保住九条完整轨迹,又做回穷搜。

对照还有 one-shot:开头侦察一轮,选中的优化器冷启动后一直跑到早停,中途不再比较。

实验覆盖 MNIST、Fashion-MNIST,以及法国车险索赔次数的 MLP 和 CLS Transformer。图像模型是约 30 万参数的全连接网,不是卷积。车险 MLP 4791 参数,Transformer 4433 参数。九个优化器学习率事先钉死:Adam、AdamW、Nadam、RMSprop 用 10⁻³,Lion 用 3×10⁻⁴,SGD-Nesterov 用 5×10⁻²,ScheduleFreeAdamW 用 2.5×10⁻³;Muon 只作用在二维隐层核上,其余参数走它的 AdamW 分支。十个相同种子,验证集选模型,测试集事后才看。

结果

最短侦察最划算。s=1 只用穷搜全部九条固定跑的 24% 到 35% 算力,也比 s=3 便宜 51% 到 68%。四项任务上,ROR 与事后最优固定优化器的成对 95% 置信区间全部穿过零;SP-ROR 对 CS-ROR 同样如此。

任务事后最优固定一周期 ROR穷搜成本s=1 成本
MNISTMuon 98.095%CS 97.948% / SP 97.988%150.737.4 / 39.6
Fashion-MNISTSF-AdamW 89.059%CS 89.007% / SP 88.992%152.453.9 / 48.4
车险 MLPLion 0.238365CS 0.238500 / SP 0.238476442.4107.8 / 110.0
车险 TransformerLion 0.237817CS 0.237627 / SP 0.237646140.842.9 / 40.7

车险 Transformer 上,一周期 ROR 的观测均值最低,但相对 Lion 的成对差仍含零。MNIST 上把侦察从 1 拉到 3,CS-ROR 大约再涨 0.184 个百分点,置信区间不含零,代价是成本翻三倍。Fashion-MNIST 和两项车险任务上,短侦察对 s=3 的成对差都含零。

one-shot 每项都比一周期 ROR 便宜。MNIST 上它以 98.116%、20.3 epoch-equivalent 同时更准更省;另外三项则是反复锦标赛的观测均值更好。时间表也对得上:MNIST 平均只换 0.5 次优化器,车险 MLP 平均换 5.6 次。排名开头就稳定的任务,问一次就够;后半段还会换人的任务,才付得起再问几次的价钱。

为什么重要

给还没定优化器的新任务,一周期侦察是穷搜的便宜替代。它没有证明「动态课表一定训出更好的模型」。Keras 3 伪代码直接能抄,对小模型和表格任务够用。大模型训练里每个 epoch 贵得多,同样逻辑能不能搬,这篇没有证据。

局限与存疑

四个任务、十个种子、最大约 30 万参数的全连接网和四五千参数的表格模型。学习率事先钉死,换一组学习率,固定排名和 ROR 时间表都可能变。SP-ROR 只给 incumbent 续状态,锦标赛比的是「接着走」对「新开一条」,不是九个优化器各自的完整历史。

同一份验证集每轮都查,时间表可能慢慢贴上这份 holdout。ROR 第一次拒收就停,固定基线却有五轮耐心,对预测结果偏苛刻,对成本数字偏好看。epoch-equivalent 也不计 Muon 矩阵运算更贵。

术语

原文与代码

社区讨论

相关论文

全部论文解读