Adapting Without Gradients: Affine Statistics Transport and What Its Certificate Can Tell You
Salim Khazem, Ibrahim Mohamed Serouis
cs.LG, cs.AI, cs.CV
2026-09-01
Talan的CASTER在冻结特征上用类共享仿射映射搬运源类高斯,28组里27组优于同特征k-NN;可搬运性证书把门控前的-3.35点翻成+1.69,同一证书套到Tent上只保住0.6%增益。
测时适应(TTA)的主流做法是推理时改网络参数。Tent、EATA 改 BatchNorm 仿射参数,SAR 还能动 LayerNorm。这条路在三类场景走不通:推理卡不提供反传、第三方 API 或冻结二进制改不了权重、优化器状态吃不起显存。更别扭的是,论文评测的 Tent/EATA 标准实现只收集 BatchNorm 参数,碰到 ConvNeXt、ViT-B/16、DeiT-B、Swin-T 这类 LayerNorm 骨干,可更新参数集合是空的,输出和冻结源模型一模一样。
CASTER 把约束再收紧一档:特征提取器和分类头都不动,只在特征空间里解析地搬一类统计量。
源数据上先用类间 / 类内散度的广义特征向量,把特征投到判别子空间。维数 k 取 min(kmax, C-1, B-1),C-1 是类间散度的秩上限,B-1 避免目标批次撑不起的方向。每个类只存投影后的均值、协方差和先验,不存源特征库。
对目标批次估一个类共享仿射映射:先把源协方差漂白,再用目标协方差上色,平移对齐均值。批次小于 2k 时改用对角版,自由度从 k² 降到 k。源类高斯被这个映射推过去,再用高斯判别打分。网络权重一步都不改。
仿射搬运不是随时能用。ImageNet-C 上 1000 类、批次只有 64,多数类根本没出现,硬搬会把几何搬崩。CASTER 加了一张可搬运性证书:把高置信伪类质心逆映射回源坐标,看残差相对最小源类间隔有多大,分子分母都用同一套马氏距离,避免坐标缩放把比值拧歪。证书 rt 超过阈值,或覆盖不足,就退回冻结头。阈值 τ=0.8 全局固定,不按数据集调。
冻结 ImageNet 预训练特征、四个骨干、七个数据集:CASTER 在 28 组里 27 组超过同一特征上的 k-NN,唯一例外是 ViT-B/16 在 CIFAR-10,差距不到 0.04 点。差距最大的是 Flowers-102,三个骨干上大约高 18–22 点。状态量中位少 18 倍;k-NN 在 Tiny-ImageNet 上光特征库就 781 MiB。反转也有:Flowers-102 训练图只有 1020 张,CASTER 的协方差状态反而更大。
| 设置 | 冻结头 | 无条件搬运 | 证书门控 |
| 307 个评估单元均值 | 0 基准 | −3.35 | +1.69(τ=0.8) |
| ResNet-50 九数据集 | 59.05 | 55.70 | 60.05 |
| ImageNet-C | 0 | −21.2 | 0(整批拒绝) |
所有掉超过 10 点的单元,证书都大于 3.9。安全带和危险带有重叠,良性单元里证书可以高到 8.9。证书能抓灾难,不能给收益排序:非退化区里分数和收益正相关,门控方向却是低分才放行。CIFAR-10-C 没有灾难搬运时,阈值门控打不过「每批都搬」。τ 从 1.0 到 3.9 大约四倍区间,收益停在 +1.85 到 +1.92,离最好值不超过 0.3 点。
损坏基准上,BatchNorm 的 ResNet 族里 Tent/EATA/SAR/CASTER 挤在一起:CIFAR-10-C 约 85.7–85.8,冻结头只有 72.0。LayerNorm 四骨干上 Tent/EATA 退化成冻结头(CIFAR-10-C 86.7),CASTER 87.4,SAR 87.3;CIFAR-100-C 上 CASTER 68.1,冻结 65.1,SAR 66.1。ImageNet-C 上 Source-GDA 掉 19.0,T3A 掉 33.5,SAR 是唯一还涨的自适应方法(+4.6)。
同一张证书套到 Tent 上:57 个 CIFAR-10-C 单元里只放行 4.3% 的更新,Tent 能拿到的增益只保住 0.6%。更松的源统计裁判放行 46.3%,也只保住 32.3%。接受率和 Tent 未门控收益的相关是 −0.86,和 CASTER 自己是 +0.72。结构原因:证书看的是更新前的冻结表征,Tent 随后改了归一化,表征已经换了。
吞吐:CIFAR-10-C fog、severity 3、ResNet-50,CASTER 1076 图/秒、峰值 1249 MiB,是 Tent 的 1.6 倍速度、22.7% 显存,相当于冻结头吞吐的 90%。
给「模型不能动」的部署留了一条轻量后路,尤其是 LayerNorm 骨干上标准 Tent 配置空转的时候。它不替代有反传时的梯度 TTA:BatchNorm ResNet 上 Tent/EATA 仍然很强。
更值得带走的是那张证书的边界。它是这个搬运机制的安全地板,不是通用「该不该适应」的分数。套到别的机制上会把最该更新的批次挡掉。
方法吃表征的现成可分性,搬统计补不回特征里没有的类别信息。它假设偏移近似类共享仿射,类相关偏移或批次里类别组成剧烈变化时会失效。证书是经验诊断,不是任意目标分布上的安全证明。
和 Tent 的对比绑定了「只收集 BatchNorm 参数」的标准实现,不能推广成「熵最小化在 LayerNorm 上不可能」。Flowers-102 上存储优势对 k-NN 是反过来的,论文有写,没有藏。