ReLU 网络缩放 99 倍预测不变,这篇论文称平坦极小值量错了指标

Are Flat Minima an Illusion?

Michael Timothy Bennett

cs.LG, cs.AI

2026-03-24

重缩放 ReLU 网络让 Hessian 迹变 99 倍而预测不变;作者提出的弱度指标以 ρ=0.29、0.47 预测泛化,平坦度则无显著相关。

这篇在解决什么

深度学习里有个流传很广的直觉:训练落到「平坦」极小值(损失曲面弯曲小的区域)的网络泛化更好。这解释好听,根上却有个毛病。平坦度在参数空间里量,泛化是函数的属性,而同一个函数可以由无数组不同的参数实现。量参数的弯曲程度,凭什么能解释函数好不好?

作者用一个干净实验把这毛病摆出来。对一个训练好的 ReLU 网络,把某一层权重乘以 β、下一层除以 β,ReLU 的正齐次性让这个操作不改变任何输出。但 Hessian 迹(参数曲率的加总)在同一个网络身上能从 66.1 拉到 6525.9,整整 99 倍,测试准确率纹丝不动地停在 0.9392。同一个函数,曲率爱是多少是多少。这一点 Dinh 等人 2017 年就提过,本文把它复现得没有漏洞:原始曲率不可能是泛化的内禀解释。

方法

作者搬出自己一套叫 Stack Theory 的框架,核心量叫「弱度」(weakness):一个模型在已经学对的约束之外,还保留多少自由去满足未来的要求。弱度大,意味着能适配的未来承诺多。

把它落到神经网上,做法叫 joint neural completion,分几步:

关键性质是仿射不变:对特征坐标做可逆线性混合和平移,JH 不变。原始 Hessian 迹没有这个不变性,会被重缩放戏耍,JH 不会。

结果

两个队列,各 100 个网络,架构 784→64→8→10,分别在 MNIST 和 Fashion-MNIST 上训练,只换随机种子。用 Spearman ρ 衡量各指标与测试准确率的排序相关,做 Holm 多重检验校正:

指标MNIST ρFashion-MNIST ρ是否过校正
Joint bank score(JH)+0.290+0.468
原始 Hessian 迹+0.091+0.056
末层相对平坦度+0.168−0.039
谱积 margin+0.504+0.546
权重 ℓ2 范数+0.398+0.361

JH 在两个队列都显著预测准确率,原始 Hessian 迹和相对平坦度都没通过校正。JH 的分半信度(Spearman-Brown)在两个队列分别达到 0.940 和 0.956。

随机标签对照组划了一条关键边界:同样的架构和种子,只把标签打乱,JH 与准确率的相关掉到 +0.058(接近零),尽管随机标签下平均 JH 反而更高(0.420 对 0.287)。JH 量的不是普适的自由度,它的预测力是任务相关的。

为什么重要

对从业者,这篇的价值有两点。一是给「平坦等于会泛化」这个默认信念打了一个具体的问号,而且成本很低:重缩放一遍、查个相关,几百行代码的事。二是给了一条函数层面、且仿射不变的替代度量思路,理论上不会被参数重参数化骗到。

但要清醒:这是小网络、两个图像数据集、低数据量(每个网络只用 250 个 child 输入)的实验。能不能搬到现代大模型上,论文没给答案。

局限与存疑

最扎眼的一条:谱积 margin 的相关点估计(+0.504、+0.546)比 JH 还大,也通过了校正。也就是说,作者自己提出的新指标在同样实验里并没有赢过一个已有的 margin 度量。作者对此是坦白的。

其余局限作者也写了:随机标签对照显示 JH 是任务相关的,不是普适自由度;线性规划求解的开销随特征维数、类别数和 bank 规模增长,规模上去会吃不消;完整的 Stack Theory 解释还要求所有网络在锚点标签上一致(共同任务条件)。整套理论也高度依赖作者本人前几年的几篇 AGI 会议论文,外部独立验证还缺。

术语

原文与代码

社区讨论

相关论文

全部论文解读