AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang
cs.CV
2026-08-12
AdvFD 指出优化静态 Fréchet 距离损失会刷分:指标涨、别的特征空间跌。它加对抗表示堵作弊方向、配白化稳训练,ImageNet 一步生成上 FD-r3 降 41.4%。
Fréchet 距离(Fréchet distance,FD)衡量两个分布的差异,在图像生成里是 FID 那类指标的计算基础。最近有人把它直接做成损失(FD-Loss)用来后训练生成器:不再只逐样本对齐,而是让生成图整体分布逼近真实分布。问题出在这套损失用的特征空间(Inception、SigLIP、MAE 这类预训练编码器)是固定、静态的,只覆盖图像语义的一部分。优化一久,生成器就学会了只在这些特征看得见的方向上作弊:目标指标一直降,但别的特征空间里、以及人眼可见的瑕疵反而停滞甚至变差。作者把这叫「Fréchet hacking」。一个实测例子:JiT-B 后训练 50k 到 75k 步,FD-r-Inception 降了 29.4%,FD-r-CLIP 却涨了 8.5%。
AdvFD 的思路是在静态 FD 目标之外,再加一个可学习的对抗表示(adversarial representation)。两者构成极小极大(min-max)博弈:对抗表示去最大化真实与生成分布之间的 Fréchet 差距,生成器去最小化同一个差距。等于是让一个「考官」专门找出生成器在静态特征看不见的地方露的破绽,逼生成器补上。
直奔作弊的朴素做法会失败:可学习编码器只要把特征幅度放大,Fréchet 距离就被平凡地撑大,优化直接崩(FID 飙到 10.69)。作者因此加了 real-feature whitening(真实特征白化):先把真实样本在该特征空间里的均值和协方差归一掉,这样单纯的尺度缩放被抵消,对抗表示只能靠真正捕捉分布差异来涨分,极小极大才稳定。
训练分两步交替:G 步冻住对抗表示、只更新生成器去降总差距;D 步冻住生成器、用裁剪过的梯度更新对抗表示去拉大差距。对抗损失权重 λadv = 0.10 最优,过大(0.20)反而退化。
在 ImageNet 256×256 的单步(one-step / 1-NFE)生成上,跨 JiT 和 pMF 两种主干、B/L/H 三个规模都稳定提升。以 JiT-L 为例:
| 指标 | FD-Loss 基线 | AdvFD | 相对提升 |
| FID | 0.77 | 0.73 | 5.2% |
| FD-r6 | 3.24 | 2.01 | 38.0% |
| FD-r3 | 5.46 | 3.20 | 41.4% |
FD-r6 是 FD-Loss 评测协议里 6 个表示(Inception、ConvNeXt、DINOv2、CLIP 等)的平均归一化 FD;训练实际只用 SIM 三件(SigLIP、Inception、MAE),FD-r3 取剩下的 ConvNeXt、DINOv2、CLIP 三个表示,专门看改进有没有泛化到训练时没优化过的特征空间。FD-r3 也大幅下降(41.4%)才是关键:说明这是泛化的画质提升,不是又刷了一种特征空间。规模更大的 JiT-H 上,FD-r6 / FD-r3 分别降 32.1% / 34.0%;像素空间 pMF-H 上,0.77/1.89/2.69 提升到 0.74/1.74/2.50。
白化是必需的:去掉白化,FID 从 0.79 飙到 10.69,FD-r6 从 3.92 飙到 58.50。作者也对比了 PatchGAN、DMD 这类别的防作弊手段,AdvFD 在 FD-r6 / FD-r3 上明显更好。
FD-Loss 是把分布级目标塞进扩散、流匹配生成器后训练的新兴方向,而「刷分」是这个方向迟早要撞上的系统性隐患。AdvFD 给了一个相对轻量的修法:不动生成器主干、只多一个对抗表示加白化,就能堵住静态特征的盲区。对做图像生成后训练、尤其追求 FID 和感知质量的工作有直接参考价值。
作者只在单步 ImageNet 类条件生成上验证,高分辨率、文本条件、视频生成都没碰(他们自承 remains to be validated)。对抗训练加白化多了超参和调参成本(λadv、梯度裁剪阈值),论文没充分讨论收敛敏感度。FD-r3 虽是留出表示,但仍是另一组固定的预训练编码器,「真正泛化到人眼」这一步没有人体评测背书,只靠更多编码器间的一致性推断。若补一个人眼偏好对照,这套结论会更硬。