Width-Independent Compressibility of Deep Neural Networks
Hong-Yi Wang, Mingze Wang, Liu Ziyin
cs.LG, cond-mat.dis-nn, cs.IT
2026-08-22
对解析激活的固定深度MLP,逐层匹配输入导数可压到O((log 1/ε)^d_in)宽,与原宽度无关;训练后网络压约304倍参数仍保住任务误差。
训练好的网络可以剪枝、量化、砍层,性能几乎不动。这个现象天天在用,理论却对不上:已有压缩保证多半盯着泛化误差或校准分布上的经验误差,真正对固定网络给出一致范数证书、并且能跨层组合的,此前只覆盖很窄的设定,比如两层置换对称网络。
问题可以问得很硬。给定一个已经训好的深度 MLP,能不能造一个同深度、窄得多的网络,在有界输入域上处处近似同一个函数?如果能,窄到什么程度才够?
对象是解析激活(sigmoid、tanh、GELU)的深度 MLP,ReLU 不在定理里。固定教师网络,输入维 \(d{\mathrm{in}}\) 当成常数,隐层很宽。
核心动作叫 derivative matching。一层的贡献写成有限个神经元的叠加。激活和上游映射都能全纯延拓到复邻域,于是匹配原点处直到 \(k\) 阶的所有输入偏导,Taylor 余项就被 \((R/\rho0)^{k+1}\) 控制住。匹配条件是有限维的,约束个数大约是 \(\binom{d{\mathrm{in}}+k}{d{\mathrm{in}}}\)。对导数特征矩阵做确定性秩约简,最多留下这么多原神经元,再重算 outgoing 权重。
\(k\) 取 \(\Theta(\log(1/\varepsilon))\) 就够,压缩后宽度因此是 \(O((\log(1/\varepsilon))^{d{\mathrm{in}}})\),公式里不再显式出现原宽度 \(d\ell\)。有效输入维可以比 \(d{\mathrm{in}}\) 更小:数据若落在 \(m\) 维解析参数化上,宽度变成 \(O((\log(1/\varepsilon))^m)\);中间层已经是瓶颈时,也可以用前面最窄层的宽度当 \(d{\mathrm{in}}\)。
多层要一起压。从最后一层隐层往回压,每步的解析常数仍被原网络控制;从前往后压会把 outgoing 范数膨胀叠进下一层的全纯半径,理论保证就没了。总误差预算 \(\varepsilon\) 均分给各层,下游 Lipschitz 因子用原网络事先上界。
单层实验用随机初始化的 \([3,2048,2048]\) 网络,隐层从 2048 压到 \(\binom{3+k}{3}\) 个神经元。sigmoid 和 GELU 在每个半径 \(R\) 上都呈几何衰减。\(R\le 1\) 时 \(k\approx 5\) 就碰到 float32 噪声地板(\(\sim 10^{-6}\));\(k=9\) 时单位球上误差低于 \(10^{-5}\)。
深层实验用随机 \([2,1024,1024,1024,1024,2]\) 网络,四层隐层一起压。\(k=10\) 时每层 \(1024\to 66\),约 15 倍宽度压缩。sigmoid 在 \(R\le 1\) 时 \(k\approx 2\) 就到噪声地板;GELU 在 \(k=10\)、\(R\le 1\) 时误差低于 \(10^{-7}\)。理论更偏好反向压缩,实验里正向和反向在 float32 精度下几乎分不开。
训练后压缩更关键。五个 seed 的 \([2,512,512,512,1]\) sigmoid MLP 拟合二维目标,不微调。任务保留标准是压缩后 MSE 不超过教师的 1.05 倍,中位首次达标宽度是 28,总参数量降约 304 倍。测试/训练 MSE 比落在 \([0.99953,0.99980]\)。形式假设在这些试验里其实被违反了(第二层 \(R/\rho\) 至少为 3),构造仍然能用。
这是一张函数级存在证书,不是又一个剪枝算法。它解释宽网络为什么能压:对固定教师,有效复杂度主要看数据维,不看你把宽度开到多大。从业者别直接拿去压 LLM。高阶导数特征又贵又吃内存,作者自己说这是存在性证明。真正能用的是尺度直觉:图像数据经验本征维大约 10–50,若匹配到 5 阶导,保留宽度大约 \(10^3\) 到 \(10^6\)。近流形版本如果做成,才挨到大模型压缩。
ReLU 不解析,整套 Cauchy 估计用不上。定理针对固定教师,宽度通过权重范数间接进来,并不保证一族越来越宽的网络共用同一个上限。实验全是 \(d{\mathrm{in}}=2\) 或 3 的玩具 MLP,没有卷积、注意力或残差。训练后试验里 Assumption 4 被违反,几何衰减还在,说明保证偏保守,也说明形式半径条件不是实用充分条件。构造本身不算实用压缩器。