Projection Pursuit CPCANet for Domain Generalization
Yu-Hsi Chen, Abd-Krim Seghouane
cs.CV
2026-07-24
PP-CPCANet 针对 CPCANet 在小批量下协方差矩阵秩亏的问题,改成在 Stiefel 流形上学全局正交基的免协方差框架;在四个域泛化基准上 VMamba-B 平均准确率 76.6% 升到 77.2%。
域泛化(Domain Generalization,DG)要让模型扛住训练时没见过的分布漂移。CPCANet 是近期一条几何对齐路线:它对每个小批量做共同主成分分析(CPCA),提取跨域不变的结构。问题出在小批量训练上,特征维度 p 远大于批量大小 n,协方差矩阵秩亏,主成分估不准,只能截断表示,白白丢信息。
PP-CPCANet(Projection Pursuit CPCANet)绕开协方差估计,改成「免协方差」框架。它不估批协方差,而是学一个全局正交基,放在 Stiefel 流形(所有列正交的矩阵构成的空间)上,和网络参数一起用 Cayley 变换联合优化,保证基始终正交。具体做法是把一个无约束向量映成反对称矩阵,再用 Cayley 变换得到正交基。
它还加了一个「对称破缺」目标:给投影维度配一组单调递减的权重(正比于 [d, d−1 直到 1]),逼方差往前面几个主成分上集中。鲁棒性上,用「去梯度的中位数」L1 离散度目标:对每个投影维,先取一批样本投影值的中位数并停梯度(stop-gradient)当锚点,再算各样本到锚点的绝对偏差的加权和。停梯度让锚点不跟着优化乱跑,L1 让目标对离群点不敏感。
在 PACS、VLCS、OfficeHome、TerraIncognita 四个 DG 基准上测,VMamba-B 骨干的结果:
| 基准 | PP-CPCANet-B | CPCANet-B |
| PACS | 93.6 | 93.2 |
| VLCS | 91.7 | 87.8 |
| OfficeHome | 79.3 | 79.7 |
| TerraIncognita | 57.7 | 57.7 |
| 平均 | 77.2 | 76.6 |
主要增益集中在 VLCS(+3.9),OfficeHome 上反而略输(79.3 对 79.7)。换骨干就没那么好看:ResNet-50 上平均 69.2,还比 CPCANet 的 69.5 低一点;VMamba-S 上 76.2 对 76.1,基本持平。消融显示最优投影维 d₁=128,最优级联深度 T=1,加深到 T 大于等于 2 不涨反退。显存在多数配置下更低,训练更稳。
对做域泛化、尤其用 CPCANet 这条几何对齐路线的人,PP-CPCANet 解决的是它在小批量下估不准协方差的硬伤,把「必须截断表示」这件事去掉了,训练也更稳。但要诚实:平均提升只有约 0.6 个点(76.6 升到 77.2),且高度依赖骨干,在 ResNet-50 上甚至轻微变差。它更像一个「让 CPCANet 在现代大骨干上能稳跑」的工程修正,不是范式级提升。T=1 就到顶、加深无益,也说明方法的表达力有限。
作者自己点明,T=1 这个浅配置最好,加深没用甚至退化,一个以级联为卖点的网络,其最优深度却是 1,这本身有点尴尬。读完还有两处存疑:一是增益高度集中在 VLCS 一个基准上,另外三个基本没动甚至略退,SOTA 的说法站得不算稳;二是 ResNet-50 上比原方法还低,方法对不同骨干的适配性没讲清楚。论文也没给计算成本与 CPCANet 的细致对照,只说显存「多数配置」更低。