Are Flat Minima an Illusion?
Michael Timothy Bennett
cs.LG, cs.AI
2026-03-24
重缩放 ReLU 网络让 Hessian 迹变 99 倍而预测不变;作者提出的弱度指标以 ρ=0.29、0.47 预测泛化,平坦度则无显著相关。
深度学习里有个流传很广的直觉:训练落到「平坦」极小值(损失曲面弯曲小的区域)的网络泛化更好。这解释好听,根上却有个毛病。平坦度在参数空间里量,泛化是函数的属性,而同一个函数可以由无数组不同的参数实现。量参数的弯曲程度,凭什么能解释函数好不好?
作者用一个干净实验把这毛病摆出来。对一个训练好的 ReLU 网络,把某一层权重乘以 β、下一层除以 β,ReLU 的正齐次性让这个操作不改变任何输出。但 Hessian 迹(参数曲率的加总)在同一个网络身上能从 66.1 拉到 6525.9,整整 99 倍,测试准确率纹丝不动地停在 0.9392。同一个函数,曲率爱是多少是多少。这一点 Dinh 等人 2017 年就提过,本文把它复现得没有漏洞:原始曲率不可能是泛化的内禀解释。
作者搬出自己一套叫 Stack Theory 的框架,核心量叫「弱度」(weakness):一个模型在已经学对的约束之外,还保留多少自由去满足未来的要求。弱度大,意味着能适配的未来承诺多。
把它落到神经网上,做法叫 joint neural completion,分几步:
关键性质是仿射不变:对特征坐标做可逆线性混合和平移,JH 不变。原始 Hessian 迹没有这个不变性,会被重缩放戏耍,JH 不会。
两个队列,各 100 个网络,架构 784→64→8→10,分别在 MNIST 和 Fashion-MNIST 上训练,只换随机种子。用 Spearman ρ 衡量各指标与测试准确率的排序相关,做 Holm 多重检验校正:
| 指标 | MNIST ρ | Fashion-MNIST ρ | 是否过校正 |
| Joint bank score(JH) | +0.290 | +0.468 | 是 |
| 原始 Hessian 迹 | +0.091 | +0.056 | 否 |
| 末层相对平坦度 | +0.168 | −0.039 | 否 |
| 谱积 margin | +0.504 | +0.546 | 是 |
| 权重 ℓ2 范数 | +0.398 | +0.361 | 是 |
JH 在两个队列都显著预测准确率,原始 Hessian 迹和相对平坦度都没通过校正。JH 的分半信度(Spearman-Brown)在两个队列分别达到 0.940 和 0.956。
随机标签对照组划了一条关键边界:同样的架构和种子,只把标签打乱,JH 与准确率的相关掉到 +0.058(接近零),尽管随机标签下平均 JH 反而更高(0.420 对 0.287)。JH 量的不是普适的自由度,它的预测力是任务相关的。
对从业者,这篇的价值有两点。一是给「平坦等于会泛化」这个默认信念打了一个具体的问号,而且成本很低:重缩放一遍、查个相关,几百行代码的事。二是给了一条函数层面、且仿射不变的替代度量思路,理论上不会被参数重参数化骗到。
但要清醒:这是小网络、两个图像数据集、低数据量(每个网络只用 250 个 child 输入)的实验。能不能搬到现代大模型上,论文没给答案。
最扎眼的一条:谱积 margin 的相关点估计(+0.504、+0.546)比 JH 还大,也通过了校正。也就是说,作者自己提出的新指标在同样实验里并没有赢过一个已有的 margin 度量。作者对此是坦白的。
其余局限作者也写了:随机标签对照显示 JH 是任务相关的,不是普适自由度;线性规划求解的开销随特征维数、类别数和 bank 规模增长,规模上去会吃不消;完整的 Stack Theory 解释还要求所有网络在锚点标签上一致(共同任务条件)。整套理论也高度依赖作者本人前几年的几篇 AGI 会议论文,外部独立验证还缺。