指标在涨画质在跌:Fréchet 距离损失的作弊方向被对抗表示堵上

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

cs.CV

2026-08-12

AdvFD 指出优化静态 Fréchet 距离损失会刷分:指标涨、别的特征空间跌。它加对抗表示堵作弊方向、配白化稳训练,ImageNet 一步生成上 FD-r3 降 41.4%。

这篇在解决什么

Fréchet 距离(Fréchet distance,FD)衡量两个分布的差异,在图像生成里是 FID 那类指标的计算基础。最近有人把它直接做成损失(FD-Loss)用来后训练生成器:不再只逐样本对齐,而是让生成图整体分布逼近真实分布。问题出在这套损失用的特征空间(Inception、SigLIP、MAE 这类预训练编码器)是固定、静态的,只覆盖图像语义的一部分。优化一久,生成器就学会了只在这些特征看得见的方向上作弊:目标指标一直降,但别的特征空间里、以及人眼可见的瑕疵反而停滞甚至变差。作者把这叫「Fréchet hacking」。一个实测例子:JiT-B 后训练 50k 到 75k 步,FD-r-Inception 降了 29.4%,FD-r-CLIP 却涨了 8.5%。

方法

AdvFD 的思路是在静态 FD 目标之外,再加一个可学习的对抗表示(adversarial representation)。两者构成极小极大(min-max)博弈:对抗表示去最大化真实与生成分布之间的 Fréchet 差距,生成器去最小化同一个差距。等于是让一个「考官」专门找出生成器在静态特征看不见的地方露的破绽,逼生成器补上。

直奔作弊的朴素做法会失败:可学习编码器只要把特征幅度放大,Fréchet 距离就被平凡地撑大,优化直接崩(FID 飙到 10.69)。作者因此加了 real-feature whitening(真实特征白化):先把真实样本在该特征空间里的均值和协方差归一掉,这样单纯的尺度缩放被抵消,对抗表示只能靠真正捕捉分布差异来涨分,极小极大才稳定。

训练分两步交替:G 步冻住对抗表示、只更新生成器去降总差距;D 步冻住生成器、用裁剪过的梯度更新对抗表示去拉大差距。对抗损失权重 λadv = 0.10 最优,过大(0.20)反而退化。

结果

在 ImageNet 256×256 的单步(one-step / 1-NFE)生成上,跨 JiT 和 pMF 两种主干、B/L/H 三个规模都稳定提升。以 JiT-L 为例:

指标FD-Loss 基线AdvFD相对提升
FID0.770.735.2%
FD-r63.242.0138.0%
FD-r35.463.2041.4%

FD-r6 是 FD-Loss 评测协议里 6 个表示(Inception、ConvNeXt、DINOv2、CLIP 等)的平均归一化 FD;训练实际只用 SIM 三件(SigLIP、Inception、MAE),FD-r3 取剩下的 ConvNeXt、DINOv2、CLIP 三个表示,专门看改进有没有泛化到训练时没优化过的特征空间。FD-r3 也大幅下降(41.4%)才是关键:说明这是泛化的画质提升,不是又刷了一种特征空间。规模更大的 JiT-H 上,FD-r6 / FD-r3 分别降 32.1% / 34.0%;像素空间 pMF-H 上,0.77/1.89/2.69 提升到 0.74/1.74/2.50。

白化是必需的:去掉白化,FID 从 0.79 飙到 10.69,FD-r6 从 3.92 飙到 58.50。作者也对比了 PatchGAN、DMD 这类别的防作弊手段,AdvFD 在 FD-r6 / FD-r3 上明显更好。

为什么重要

FD-Loss 是把分布级目标塞进扩散、流匹配生成器后训练的新兴方向,而「刷分」是这个方向迟早要撞上的系统性隐患。AdvFD 给了一个相对轻量的修法:不动生成器主干、只多一个对抗表示加白化,就能堵住静态特征的盲区。对做图像生成后训练、尤其追求 FID 和感知质量的工作有直接参考价值。

局限与存疑

作者只在单步 ImageNet 类条件生成上验证,高分辨率、文本条件、视频生成都没碰(他们自承 remains to be validated)。对抗训练加白化多了超参和调参成本(λadv、梯度裁剪阈值),论文没充分讨论收敛敏感度。FD-r3 虽是留出表示,但仍是另一组固定的预训练编码器,「真正泛化到人眼」这一步没有人体评测背书,只靠更多编码器间的一致性推断。若补一个人眼偏好对照,这套结论会更硬。

术语

原文与代码

相关论文

全部论文解读