傅里叶双频自监督把CUB新类准确率推到82.7%

Fourier Self-Supervision for Fine-Grained Generalized Category Discovery

Sarah Rastegar, Mina Ghadimi Atigh, Pascal Mettes, Yuki M. Asano, Cees G. M. Snoek

ECCV 2026

cs.CV, cs.AI, cs.LG

2026-08-10

把图像拆成低频糊图和高频纹理做对比学习,接到SelEx上得到FourEx;DINOv1下CUB新类准确率82.7%,三套细粒度平均提升4.4点。

这篇在解决什么

Generalized Category Discovery(GCD,广义类别发现)要模型同时认出已标注的已知类,并把未标注池里的新类聚出来。主流路子是对比学习:同一张图的两种增强当正样本。粗粒度物体差得远,这条路还走得通;到鸟种、飞机型号这种细粒度设定,类间差本来就挤在喙形、羽纹、进气口这类局部,随机裁切和颜色抖动正好把这些信号打没。

现有方法还通常只在一个扁平特征空间里拉近、推远。细粒度类别其实带着隐式层级:先分「林鸟还是海鸟」,再分到种。低频成分更像上层节点,高频才承载种间差。阿姆斯特丹大学和纽伦堡工业大学这篇 ECCV 2026 论文,把这条频域直觉做成可插拔的自监督,接到现成 GCD 基线上就能用。

方法

核心叫 Fourier Self-Supervision。每张图做 FFT,并行过低通和高通,再 IFFT 回空间域,得到一张糊成色块的图和一张只剩边缘纹理的图。两张都当原图的正视图,塞进对比学习。

截止频率按数据定。先在训练集上扫一圈,取信噪比(SNR)约 15 dB 的截止当上限:再糊,人眼也分不清类别;再锐,就主要是噪声。训练时随机抽一个低于上限的截止。滤波前加 5×5 高斯模糊,压 Gibbs 振铃。

潜空间被切开用:

再加一项分类损失:原图、低通重建、高通重建必须预测同一个已知类标签。总损失是基线 GCD 损失加上这三项,默认权重都是 0.1。接到 SimGCD 上叫 FourSim,接到 SelEx 上叫 FourEx。主干 ViT-B/16,DINOv1 或 DINOv2 预训练;FourEx 微调最后三块。代码仓库名 FourEx。

结果

DINOv1 上,FourEx 相对「同样微调最后三块的 SelEx」在三个细粒度集上全面抬升:

方法CUB All / Known / NovelAircraftCars三集平均 All
SelEx†76.4 / 72.4 / 78.461.2 / 67.7 / 58.056.9 / 76.9 / 47.364.8
FourEx80.2 / 75.1 / 82.765.9 / 67.9 / 64.959.2 / 76.9 / 50.668.4

相对各自基线的平均提升是 All +4.3、Known +4.0、Novel +4.4。FourSim 相对 SimGCD 在 CUB 上从 60.3 拉到 70.3。类数未知、用 Vaze 的方法估成 CUB 231 类时,FourEx 的 All 仍有 77.3,高于 SelEx 的 72.0。

DINOv2 上红利变薄:CUB All 只从 87.4 到 87.8,Aircraft 从 79.8 到 81.5,Stanford Cars 反而从 82.2 掉到 80.1。论文的解释是 Cars 类间差更明显,细粒度红利更小。长尾的 Herbarium19 上 FourEx All 44.5,对 SelEx 的 39.6;小样本 Oxford-Pet 几乎打平(92.8 vs 92.5)。消融里三项损失都有贡献,去掉任何一项 CUB All 都会掉;把权重拉到 1.0 会明显伤性能,15 dB 在 5–25 dB 扫描里最好。附录粗粒度 CIFAR-10/100 和 ImageNet-100 上,FourEx 平均 All 87.7,和 SPTNet 的 88.0 同一档。时间账:FourEx 每 epoch 90.69 秒,SelEx 84.29 秒,参数量和 FLOPs 不变。

为什么重要

这是一条可插拔的频域增强,不改主干、不改聚类头。对细粒度开集识别、标本分拣、工业缺陷这种「已知类很少、新类很多且长得像」的场景,低频建层级、高频抠差异这条分工,比再堆一种伪标签策略更对症。DINOv2 上增益缩水,说明表征已经很强时,频域视图的边际变小,别指望它无脑刷新所有榜。

局限与存疑

失败案例集中在遮挡、反光和颜色错配。高通把颜色滤掉了,模型对色相更脆弱。DINOv2 加 Stanford Cars 出现负增益,细粒度假设并不是处处成立。类数估计仍沿用 Vaze 的旧法,估出来的 231 / 230 跟真值差一截,却没有报告估计误差对聚类的敏感度。15 dB 这个 SNR 门槛来自视频主观质量惯例,跟「类别可分」不是同一件事。论文把「低频等于隐式层级」写得很满,但没有直接验证潜空间左半是否真的编码了父类,主要靠直觉和消融撑着。

术语

原文与代码

社区讨论

相关论文

全部论文解读