Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks
Hossein Mobahi, Peter L. Bartlett
cs.LG, cs.AI, stat.ML
2026-07-23
Google DeepMind 将神经元建模为 Hilbert-Schmidt 算子,用 BN 统计量解析计算功能容量,实现无数据渐进压缩,衍生的 DEFT 迁移框架 H-Score 达 65.82,远超 EWC 的 12.54。
Batch Normalization 在推断时做的事很简单:把输入权重乘以一个比例因子,再让归一化层除掉它。这意味着一个神经元的权重乘以 10 或除以 10,下游输出完全不变,但量级排名天差地别。标准剪枝靠 L1 范数或 BN 缩放因子 γ 判断重要性,这两种方法都被「尺度对称性」搞坏了:被判定为不重要的神经元,可能只是量级被 BN 压缩过,不代表功能上没贡献。基于激活的方法能绕开这个问题,但需要跑大量前向传播,数据不可用或做持续学习时代价高。
HOPE 把神经元从参数空间搬到 Hilbert 函数空间。每个神经元被建模为秩 1 的 Hilbert-Schmidt 算子 fi = gi ⊗ wout,i,其中 gi(x) = Ψ(wineff^T x + bi) 是神经元对输入的标量响应函数,Ψ 是 ReLU 这类正齐次激活函数,wout,i 是输出权重向量。神经元的「容量」定义为算子的 Hilbert-Schmidt 范数:‖fi‖H = ‖wout,i‖2 × √K(i,i),K(i,i) 是激活信号的期望平方能量。
为了不依赖真实数据计算 K(i,i),HOPE 用极大熵原理把 BN 移动统计量(均值 μi、方差 σi²)映射为多变量高斯代理分布 PX,然后对 ReLU 情形推导出 K(i,i) 的解析闭合表达式。整个容量评估不需要任何前向传播。
三种压缩操作在同一框架下定义:剪枝把神经元投影到零算子;合并用两个神经元联合子空间的最优秩 1 逼近生成父神经元,方向由特征值分解给出;块驱逐将整个残差分支归零,代价表述为与跳跃连接容量之比的上界。贪心优化器按「失真率 = 代价 J / 参数释放量 ΔP」排序,每步执行代价最小的操作。
HOPE 在此基础上衍生出 DEFT(Dispersed Elastic Fine-Tuning):以容量阈值把网络分成冻结核心(高容量神经元)和可塑冗余区(低容量神经元),迁移时截断冗余区到核心的连接,防止目标任务梯度污染源域表征。
模型压缩实验在 Keras ResNet-50(ImageNet 预训练)上对比三条结构化基线:L1 范数输入剪枝、L1 范数联合剪枝、BN 缩放剪枝。在所有模型密度区间,HOPE 的准确率曲线均高于三条基线,结果以图示呈现,论文未给出精确对照数值。
跨域迁移实验(CIFAR-100 → SVHN,4 次独立试验,各含 5 个任务,共 20 个场景):
| 方法 | SVHN 准确率 | CIFAR 保留率 | H-Score |
| DEFT | 89.79 ± 0.84 | 52.14 ± 5.29 | 65.82 ± 3.96 |
| Head-Only FT | 36.11 ± 2.79 | 63.13 ± 4.62 | 45.79 ± 2.05 |
| Full FT | 94.09 ± 0.28 | 7.52 ± 1.63 | 13.88 ± 2.84 |
| EWC | 93.94 ± 0.22 | 6.74 ± 1.74 | 12.54 ± 2.99 |
| PEFT | 81.91 ± 0.49 | 5.44 ± 0.98 | 10.18 ± 1.63 |
Full FT 目标准确率最高(94.09%),但源域保留几乎归零(7.52%)。DEFT 在 SVHN 上比 Full FT 低 4 个百分点,但源域保留提升约 45 个百分点,H-Score 从 13.88 跳到 65.82。
HOPE 给「结构化压缩在优化什么」这个问题一个清晰答案:功能容量,不是参数量级。对从业者来说最实用的有两点:无超参数,整个压缩过程由代价函数自动决定,省去调剪枝率和重要性阈值的工作;无数据依赖,对数据合规受限场景(医疗、金融)有直接价值。DEFT 解决的是 EWC 系方法绕不开的问题:EWC 需要完整跑源域数据来计算 Fisher 矩阵(O(N³) 开销),DEFT 靠容量评分在无数据前提下完成分区,且 H-Score 高出所有基线 20 分以上。
论文明确说明:这是概念验证型实验,目标是证明理论可行性,而非建立大规模对照。压缩实验只有一个 ResNet-50 检查点,迁移实验只用了 8 层 VGG 风格 CNN 在 CIFAR-100/SVHN 上跑,规模偏小。与现代参数高效微调方法(LoRA、DoRA)没有直接对比。
框架在结构上依赖 BN 层:对于使用 LayerNorm 或 RMSNorm 的 Transformer 网络,需要额外做一次校准前向传播。大型网络的核函数计算采用了零偏置近似,在偏置项较大的层上会引入系统性误差。