Adam 的逐坐标更新破坏规范对称性,丢掉梯度下降的低秩偏置

The Loss Does Not See the Basis, but Adam Does

Devender Singh

cs.LG, math.OC, stat.ML

2026-08-06

在 W=UV⊤ 分解模型上,梯度下降自发找低秩解,Adam 却不能。根因是 Adam 的逐坐标二阶矩破坏了规范对称性,九种优化器按恢复误差裂成两类,等变类比逐坐标类低一个量级。

这篇在解决什么

把一个矩阵拆成两个瘦长矩阵相乘 W = UV⊤,是低秩建模的标配:矩阵感知、推荐系统、LoRA 微调都这么干。这种参数化有一个老问题。从同样的小初始化出发,梯度下降(GD)会自发地找到低秩解,Gunasekar 等人 2017 年就证明了这一点;但同样初始化下的 Adam 却找不到,会停在又高秩又拟合得差的解上。这个现象被观察了八年,一直没人说清为什么。

这篇把答案锁定在一个之前被忽视的几何性质上:规范对称性(gauge symmetry)。损失函数 L(U,V) 只依赖乘积 UV⊤,所以对任何正交矩阵 Q,把 (U,V) 换成 (UQ,VQ),乘积不变,损失也不变。损失函数「看不见」你给那个 k 维潜空间挑了哪组正交基。但 Adam 看得见:它是逐坐标(每个参数独立)算二阶矩的,换一组基,它的更新方向就变了。标题「The Loss Does Not See the Basis, but Adam Does」说的就是这件事。

方法

作者把这条线索做成了一个完整的形式化框架。

第一步是定义规范等变(gauge equivariance):一个优化器规范等变,是指它在所有规范等价的分解上行为一致,只依赖乘积或 Gram 这类不变量,不依赖你挑了哪组基。GD 天然等变,梯度在基变换下协变,轨迹只跟着不变量走。Adam 不等变,它的逐坐标二阶矩把那组基当成了特殊的。

接着是一个结构定理(structure theorem):所有无记忆的等变更新规则,恰好是「由 Gram 决定的左预条件」形式 Φ(G) = H(GG⊤)G,更新只能通过不变量 GG⊤ 依赖当前因子。这把「等变」从一个性质变成了完整刻画。配套的迁移定理(transfer theorem)说,共享标量的预条件动力学等价于重新标定时间后的 GD,所以 GD 的逐路径性质能直接搬到共享标量的流上。

最干净的因果隔离是一个叫 Adam-p 的旋钮:p = 1 是标准 Adam(逐坐标),p = 0 是共享标量 Adam(等变),中间连续插值。这个旋钮唯一改变的,是二阶矩分母里各向异性的程度。结果单调:随着 p 从 1 走向 0,恢复误差和有效秩都单调改善。也就是说,把 Adam 改成等变的那个量,正是逐坐标的各向异性。

结果

核心证据是一张「优化器动物园」表。在 40×40、真实秩 3、完全过参数化(k = n = 40)的矩阵感知任务上,九种更新规则跑到完全插值(训练损失都趋近零),按对真实矩阵的恢复误差排开,干净地裂成两类:

类别优化器恢复误差 ‖W−X∗‖F/‖X∗‖F有效秩
等变Muon6.8×10⁻⁶(近精确)2.95
等变GD0.1314.51
等变scalar-Adam0.2015.43
等变Shampoo0.2866.95
逐坐标Lion0.42510.58
逐坐标signum0.4457.83
逐坐标RMSProp0.52712.80
逐坐标Adafactor0.54310.72
逐坐标Adam0.57314.37

四个等变方法的恢复误差都 ≤ 0.286,五个逐坐标方法都 ≥ 0.42,两类之间留了 0.14 的空档。所有方法都把训练损失压到同一水平,差别只能来自「选了哪一个插值解」。真实矩阵秩是 3,Muon 落在有效秩 2.95(精确恢复),Adam 却落在 14.37,远超真实秩。这张表按各方法自己网格上最好的学习率取数,而这个选择其实偏向逐坐标方法,所以两类的间隔是个保守的下界。

在 transformer 上,作者构造两个规范等价的初始化。Adam 在第一步就把它们分开了,而所有等变优化器前几步都停在机器精度上无法区分。最终两者的逐头不变量 WQ⊤WK 在相对 Frobenius 距离上差了 56%,而且这个差距落在不变量本身上,任何逐头旋转都抹不平。

真实数据上,两个高光谱图像补全任务里,在相同训练损失下,GD 把留出集 RMSE 最多砍掉 43%–44%,出现在采样密度最低、有效秩最低时。

关于 Muon,作者用一个「谱调度」相图调停了两份相反的报告。当真实矩阵谱干净(尾部能量低于约 4%)时,Muon 的等率更新能精确恢复低秩目标;一旦谱尾变重,等率调度的优势消失,GD 的贪心调度反而赢。这解释了为什么有人看到 Muon 有强低秩偏好、有人却看到它丢掉了这种偏好。

为什么重要

这篇给「为什么 Adam 和 GD 在分解模型上行为不同」补上了机制层面的答案,而这个答案有一个能落地的推论。任何依赖低秩归纳偏置的参数化,比如 LoRA、低秩注意力、矩阵补全,配上 Adam(逐坐标)时,你以为是免费的低秩偏置其实在被悄悄磨掉。要保住它,得用等变优化器,或者把 Adam 的二阶矩从逐坐标换成共享标量。

对优化器设计,它给了一个干净的判据:规范等变性。要保留 GD 那条路的隐式偏置,等变性是必要条件(虽不充分)。Muon、Shampoo 这类结构化优化器有效,部分原因正是它们碰巧满足等变。

但要说清楚:这是一篇机制解释,不是调参建议。作者自己写明,「我们提供的是对一个观察到的现象的机制解释」,这个偏置在常见规模上效果温和,不承诺刷榜。

局限与存疑

作者自述的局限,加上读完之后值得保留的怀疑:

术语

原文与代码

社区讨论

相关论文

全部论文解读