Fourier Self-Supervision for Fine-Grained Generalized Category Discovery
Sarah Rastegar, Mina Ghadimi Atigh, Pascal Mettes, Yuki M. Asano, Cees G. M. Snoek
ECCV 2026
cs.CV, cs.AI, cs.LG
2026-08-10
把图像拆成低频糊图和高频纹理做对比学习,接到SelEx上得到FourEx;DINOv1下CUB新类准确率82.7%,三套细粒度平均提升4.4点。
Generalized Category Discovery(GCD,广义类别发现)要模型同时认出已标注的已知类,并把未标注池里的新类聚出来。主流路子是对比学习:同一张图的两种增强当正样本。粗粒度物体差得远,这条路还走得通;到鸟种、飞机型号这种细粒度设定,类间差本来就挤在喙形、羽纹、进气口这类局部,随机裁切和颜色抖动正好把这些信号打没。
现有方法还通常只在一个扁平特征空间里拉近、推远。细粒度类别其实带着隐式层级:先分「林鸟还是海鸟」,再分到种。低频成分更像上层节点,高频才承载种间差。阿姆斯特丹大学和纽伦堡工业大学这篇 ECCV 2026 论文,把这条频域直觉做成可插拔的自监督,接到现成 GCD 基线上就能用。
核心叫 Fourier Self-Supervision。每张图做 FFT,并行过低通和高通,再 IFFT 回空间域,得到一张糊成色块的图和一张只剩边缘纹理的图。两张都当原图的正视图,塞进对比学习。
截止频率按数据定。先在训练集上扫一圈,取信噪比(SNR)约 15 dB 的截止当上限:再糊,人眼也分不清类别;再锐,就主要是噪声。训练时随机抽一个低于上限的截止。滤波前加 5×5 高斯模糊,压 Gibbs 振铃。
潜空间被切开用:
再加一项分类损失:原图、低通重建、高通重建必须预测同一个已知类标签。总损失是基线 GCD 损失加上这三项,默认权重都是 0.1。接到 SimGCD 上叫 FourSim,接到 SelEx 上叫 FourEx。主干 ViT-B/16,DINOv1 或 DINOv2 预训练;FourEx 微调最后三块。代码仓库名 FourEx。
DINOv1 上,FourEx 相对「同样微调最后三块的 SelEx」在三个细粒度集上全面抬升:
| 方法 | CUB All / Known / Novel | Aircraft | Cars | 三集平均 All |
| SelEx† | 76.4 / 72.4 / 78.4 | 61.2 / 67.7 / 58.0 | 56.9 / 76.9 / 47.3 | 64.8 |
| FourEx | 80.2 / 75.1 / 82.7 | 65.9 / 67.9 / 64.9 | 59.2 / 76.9 / 50.6 | 68.4 |
相对各自基线的平均提升是 All +4.3、Known +4.0、Novel +4.4。FourSim 相对 SimGCD 在 CUB 上从 60.3 拉到 70.3。类数未知、用 Vaze 的方法估成 CUB 231 类时,FourEx 的 All 仍有 77.3,高于 SelEx 的 72.0。
DINOv2 上红利变薄:CUB All 只从 87.4 到 87.8,Aircraft 从 79.8 到 81.5,Stanford Cars 反而从 82.2 掉到 80.1。论文的解释是 Cars 类间差更明显,细粒度红利更小。长尾的 Herbarium19 上 FourEx All 44.5,对 SelEx 的 39.6;小样本 Oxford-Pet 几乎打平(92.8 vs 92.5)。消融里三项损失都有贡献,去掉任何一项 CUB All 都会掉;把权重拉到 1.0 会明显伤性能,15 dB 在 5–25 dB 扫描里最好。附录粗粒度 CIFAR-10/100 和 ImageNet-100 上,FourEx 平均 All 87.7,和 SPTNet 的 88.0 同一档。时间账:FourEx 每 epoch 90.69 秒,SelEx 84.29 秒,参数量和 FLOPs 不变。
这是一条可插拔的频域增强,不改主干、不改聚类头。对细粒度开集识别、标本分拣、工业缺陷这种「已知类很少、新类很多且长得像」的场景,低频建层级、高频抠差异这条分工,比再堆一种伪标签策略更对症。DINOv2 上增益缩水,说明表征已经很强时,频域视图的边际变小,别指望它无脑刷新所有榜。
失败案例集中在遮挡、反光和颜色错配。高通把颜色滤掉了,模型对色相更脆弱。DINOv2 加 Stanford Cars 出现负增益,细粒度假设并不是处处成立。类数估计仍沿用 Vaze 的旧法,估出来的 231 / 230 跟真值差一截,却没有报告估计误差对聚类的敏感度。15 dB 这个 SNR 门槛来自视频主观质量惯例,跟「类别可分」不是同一件事。论文把「低频等于隐式层级」写得很满,但没有直接验证潜空间左半是否真的编码了父类,主要靠直觉和消融撑着。