Google DeepMind 用 Hilbert 算子统一神经网络剪枝与合并,无需任何训练数据

Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks

Hossein Mobahi, Peter L. Bartlett

cs.LG, cs.AI, stat.ML

2026-07-23

Google DeepMind 将神经元建模为 Hilbert-Schmidt 算子,用 BN 统计量解析计算功能容量,实现无数据渐进压缩,衍生的 DEFT 迁移框架 H-Score 达 65.82,远超 EWC 的 12.54。

这篇在解决什么

Batch Normalization 在推断时做的事很简单:把输入权重乘以一个比例因子,再让归一化层除掉它。这意味着一个神经元的权重乘以 10 或除以 10,下游输出完全不变,但量级排名天差地别。标准剪枝靠 L1 范数或 BN 缩放因子 γ 判断重要性,这两种方法都被「尺度对称性」搞坏了:被判定为不重要的神经元,可能只是量级被 BN 压缩过,不代表功能上没贡献。基于激活的方法能绕开这个问题,但需要跑大量前向传播,数据不可用或做持续学习时代价高。

方法

HOPE 把神经元从参数空间搬到 Hilbert 函数空间。每个神经元被建模为秩 1 的 Hilbert-Schmidt 算子 fi = gi ⊗ wout,i,其中 gi(x) = Ψ(wineff^T x + bi) 是神经元对输入的标量响应函数,Ψ 是 ReLU 这类正齐次激活函数,wout,i 是输出权重向量。神经元的「容量」定义为算子的 Hilbert-Schmidt 范数:‖fi‖H = ‖wout,i‖2 × √K(i,i),K(i,i) 是激活信号的期望平方能量。

为了不依赖真实数据计算 K(i,i),HOPE 用极大熵原理把 BN 移动统计量(均值 μi、方差 σi²)映射为多变量高斯代理分布 PX,然后对 ReLU 情形推导出 K(i,i) 的解析闭合表达式。整个容量评估不需要任何前向传播。

三种压缩操作在同一框架下定义:剪枝把神经元投影到零算子;合并用两个神经元联合子空间的最优秩 1 逼近生成父神经元,方向由特征值分解给出;块驱逐将整个残差分支归零,代价表述为与跳跃连接容量之比的上界。贪心优化器按「失真率 = 代价 J / 参数释放量 ΔP」排序,每步执行代价最小的操作。

HOPE 在此基础上衍生出 DEFT(Dispersed Elastic Fine-Tuning):以容量阈值把网络分成冻结核心(高容量神经元)和可塑冗余区(低容量神经元),迁移时截断冗余区到核心的连接,防止目标任务梯度污染源域表征。

结果

模型压缩实验在 Keras ResNet-50(ImageNet 预训练)上对比三条结构化基线:L1 范数输入剪枝、L1 范数联合剪枝、BN 缩放剪枝。在所有模型密度区间,HOPE 的准确率曲线均高于三条基线,结果以图示呈现,论文未给出精确对照数值。

跨域迁移实验(CIFAR-100 → SVHN,4 次独立试验,各含 5 个任务,共 20 个场景):

方法SVHN 准确率CIFAR 保留率H-Score
DEFT89.79 ± 0.8452.14 ± 5.2965.82 ± 3.96
Head-Only FT36.11 ± 2.7963.13 ± 4.6245.79 ± 2.05
Full FT94.09 ± 0.287.52 ± 1.6313.88 ± 2.84
EWC93.94 ± 0.226.74 ± 1.7412.54 ± 2.99
PEFT81.91 ± 0.495.44 ± 0.9810.18 ± 1.63

Full FT 目标准确率最高(94.09%),但源域保留几乎归零(7.52%)。DEFT 在 SVHN 上比 Full FT 低 4 个百分点,但源域保留提升约 45 个百分点,H-Score 从 13.88 跳到 65.82。

为什么重要

HOPE 给「结构化压缩在优化什么」这个问题一个清晰答案:功能容量,不是参数量级。对从业者来说最实用的有两点:无超参数,整个压缩过程由代价函数自动决定,省去调剪枝率和重要性阈值的工作;无数据依赖,对数据合规受限场景(医疗、金融)有直接价值。DEFT 解决的是 EWC 系方法绕不开的问题:EWC 需要完整跑源域数据来计算 Fisher 矩阵(O(N³) 开销),DEFT 靠容量评分在无数据前提下完成分区,且 H-Score 高出所有基线 20 分以上。

局限与存疑

论文明确说明:这是概念验证型实验,目标是证明理论可行性,而非建立大规模对照。压缩实验只有一个 ResNet-50 检查点,迁移实验只用了 8 层 VGG 风格 CNN 在 CIFAR-100/SVHN 上跑,规模偏小。与现代参数高效微调方法(LoRA、DoRA)没有直接对比。

框架在结构上依赖 BN 层:对于使用 LayerNorm 或 RMSNorm 的 Transformer 网络,需要额外做一次校准前向传播。大型网络的核函数计算采用了零偏置近似,在偏置项较大的层上会引入系统性误差。

术语

原文与代码

社区讨论

相关论文

全部论文解读