MIT 用排列对称性统一 17 种网络模型:骤变学习与幂律同源

Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws

Liu Ziyin, Yizhou Xu, Tomaso Poggio, Isaac Chuang

cs.LG, cond-mat.dis-nn, cond-mat.stat-mech

2026-08-13

小初始化下任何网络层都归约为同一个二次型,其动力学既出骤变学习台阶也出幂律 loss,17 个可解模型就此统一。

这篇在解决什么

神经网络训练里有一对长期并存的矛盾现象。一种是骤变学习:loss 长时间趴在平台期上,然后突然陡降,像是「学会了一个特征」。另一种是平滑的幂律:loss 随训练时间按 power law 一路缓降。微观结构差异极大的架构(MLP、CNN、attention、MoE)都表现出这两种行为的变体,统计物理的直觉说,这是少数集体变量主导动力学的信号。此前两套现象各有一批理论:kernel 方法能推出幂律,但线性化在初始化附近、冻结了表示,看不到特征生长;saddle-to-saddle 分析能解释台阶,但只针对特定目标函数。这篇要的是同一个动力学同时产出两种现象,并且说清集体变量到底是什么。

方法

出发点是对称性。一层是 d 个可交换单元的求和,给单元重新编号,函数值不变,这和全同粒子的交换对称是同一件事。有了对称群,就按朗道相变理论的套路走:找小参数(初始化尺度 ε),在参数空间原点附近展开,只留对称性允许的最低阶项。定理 1 是结果:任何满足三阶可微和「单元梯度在原点为零」的层,都服从

f(W) − f(0) = μᵀg(x) + Tr[WWᵀA(x)] + O(‖W‖³)

这就是 neural quadratic form(NQF,神经二次型)。全部架构细节被压进一个结构矩阵 A(x):perceptron、attention、MoE、卷积是同一个模型取不同的 A。attention 是最出人意料的例子,二阶展开里只有 value 和 readout 块,query/key 要到四阶才进场。含义是:小初始化训练的早期,一个 attention 头近似一个平均算子。

动力学部分有两个结果。第一,闭合:SGD 下 NQF 的演化完全由 (M, μ) = (Σwᵢwᵢᵀ, Σwᵢ) 这对低维矩决定,宽度多大都一样。直接推论是压缩定理:宽度 d 的模块存在 kV+1 宽的等价模块(kV 由数据秩决定),重标学习率后在训练数据上逐步复现原模块的预测。第二,可解:当数据矩阵共享特征基时,M 的流降为广义 Lotka–Volterra 方程,就是种群生态学那套捕食者-猎物方程,M 的特征值当物种丰度。模式一个接一个开启,开启时刻 tk ≈ (1/rk)·ln(1/ε)。初始化越小,时刻分得越开,平台期越清楚;平台是光滑流在 ε→0 下的奇异极限,和相变只在无穷大系统里才严格尖锐是同一个机制。当大量开启时刻挤在一起分辨不开,同一串事件合并成一条幂律,理论给出的指数 t^−(2β−1)/(θ+β) 在 Fourier 特征实验里直接对上实测。

结果

近似精度、台阶时刻、幂律指数三层验证:

验证项结果对照
NQF 跟踪原模型(σ=0.01)MLP/CNN/attention × GD/momentum/Adam 几乎精确σ=0.2 明显偏离
台阶时刻逐特征、逐样本的陡降均落在预测的 tk、tμ 上理论曲线与 GD 标记重合
幂律指数t^−(2β−1)/(θ+β),θ∈{0, 0.5, 1} 全对上原始输入训练的标准 MLP 不出幂律

近似实验的设置:每个模块与它的 NQF 近似一起训练,教师是奇异值为 (1, 1/2, 1/4, 1/8) 的 NQF,曲线看恢复的第 k 个奇异值;台阶实验里样本数做到 m=1000。

另一条硬结果是统一性:matrix sensing、phase retrieval、diagonal networks 等 17 个此前各自独立研究的可解代理模型,全是 NQF 取特定 A 的实例。A(x) 可以在一层被训练之前就算出来,层设计多了一个分析工具。

为什么重要

对做训练动力学理论的人,这是把一堆孤岛并成一块大陆:以前每个可解模型要单独推一遍,现在只需换 A(x)。骤变学习和幂律不再是两套互相不服的现象,而是同一方程在「时刻分得开」与「时刻分不开」两个极限下的形态。对工程侧的可用产出是压缩定理,它给「训练动力学本质上低维」这个经验观察一个构造性版本:低秩数据上,极窄的等价网络能逐步复现宽网络的预测。

定位要诚实:文中的 scaling law 是单次运行内 loss 对训练时间的幂律,不是 Chinchilla 那类对模型规模、数据量、算力的缩放律。它把「为什么有幂律」归约为「为什么算子谱有幂律尾巴」,后一个问题仍然开放。

局限与存疑

作者自己列了五条:只在小初始化下有效,σ=0.2 就失效;三阶可微假设把 ReLU 在原点、bias 项、归一化层都排除在外,而生产级 LLM 恰好大量用 ReLU 族激活;实验里存在 NQF 解释不了的平台期,作者归因于三阶以上项;幂律谱是假设不是预测,Fourier 实验是刻意构造出这个谱的;Adam 在实验里被跟踪得很好,但线性更新推论不覆盖它。

另有一处存疑在名单之外:多层组合只在附录 B.4 开了个头。真实 LLM 几十上百层,层间耦合会不会破坏单层的闭合性,文中没有答案,而这恰好是从玩具定理走到解释真实训练必须过的坎。

术语

原文与代码

社区讨论

相关论文

全部论文解读