Adversarial Learning of Classifier-Free Guidance Schedules
Ashwini Pokle, Alexandre Galashov, Arnaud Doucet, Mauricio Delbracio, Valentin De Bortoli
cs.LG
2026-08-14
把 CFG 常数引导权重换成轻量 MLP 按时间步与 prompt 实时输出的动态权重,判别器当密度比估计器,MS-COCO 人类偏好指标全面超过常数与手工调度
文生图模型出图离不开 CFG(classifier-free guidance,免分类器引导):采样时把「看 prompt 的速度场」与「不看 prompt 的速度场」做线性外推,把轨迹往 prompt 方向推。外推权重 ω 惯例取 7.5 上下的一个常数,对所有时间步、所有样本、所有 prompt 一视同仁,这个设置从 2022 年沿用至今。
常数权重的代价早有共识:过饱和、伪影,权重越高越明显。去噪早期与后期需要的引导强度本就不同,「一只黑狗」和「过去与现在并排的同一个房间」需要的强度也不同。改良分两条线。手工动态调度,比如 LIG 只在中间时间区间施加引导、CLG 分段线性变化,有效但超参要按数据集重调,依然不看 prompt;可学习调度,同批作者先前的工作用 MMD(maximum mean discrepancy,一种核方法的两分布距离)配 energy kernel 强制分布匹配,训练稳定,文本对齐没能超过常数 CFG。卡点在监督信号:固定核的 MMD 在高维 latent 上估分布差距,梯度方差大。
这篇论文把估计器换掉,用 GAN 的判别器来当这个监督。
学习目标是边缘一致性:从时间 s 用引导速度走一步到 t,粒子的分布应当贴合真实前向加噪在 t 时刻的分布。把这个贴合写成 KL 散度,展开后只剩密度比 pt(x)/pt^{s,ω}(x) 一项。GAN 的经典结论正好接上:最优判别器的 logit 等于 log 密度比。于是不需要手工设计核,判别器自己就是密度比估计器。
训练循环里三个组件各司其职:
训练按 TTUR(判别器与生成器用不同学习率的稳定化做法)交替更新,共 60000 步;真样本与假样本用独立采样的图片-prompt 对,避免判别器靠辨认单条轨迹作弊。推理时判别器整个下线,跟着采样循环跑的只有那个 MLP,额外开销可以忽略。这是与 discriminator guidance 一族的关键区别:那些方法在推理期用判别器修正 score,推理变贵;这里判别器只是训练期的监督信号。另一处细节:CFG 的「无条件」分支统一用固定负向 prompt(模糊、畸形、劣质绘制等)替代空条件,基线方法同等对待,出图质量比空条件高。
MS-COCO 512×512,自训 flow matching(把噪声连续变换成数据的一类扩散框架)模型 MMDiT-S(1.05B),主干全程冻结:
| 方法 | FID ↓ | CLIP ↑ | Aesthetic ↑ | HPSv2 ↑ |
| 常数 ω=7.5 | 31.11 | 0.3063 | 5.31 | 0.2850 |
| LIG(手工调度) | 24.95 | 0.3042 | 5.31 | 0.2843 |
| MMD+SC(先前可学习) | 28.55 | 0.3067 | 5.29 | 0.2847 |
| GAN+MC(这篇) | 31.70 | 0.3068 | 5.34 | 0.2856 |
四个对齐与偏好指标全部拿到组内最高或并列最高,740M 的 MMDiT-XS 上结论相同(CLIP 0.3048、Aesthetic 5.32、HPSv2 0.2829)。PickScore 与常数 CFG 打平(0.2214)。
FID 是反向的。GAN+MC 在两个模型上都落在最差一档:小模型上 31.31,比常数 CFG 高 1.6,比 LIG 高 5.7。论文的解释是对抗训练加 CLIP 奖励优化会优先语义与「视觉讨喜」,牺牲低层 Inception-v3 统计的匹配,并引用了 FID 与人类审美在高引导区间错位的既有研究。
消融部分信息量足:MLP 吃几何统计量优于卷积网络吃原始 latent(Aesthetic 5.32 对 5.26);去掉 CLIP 奖励项,HPSv2 从 0.2927 掉到 0.2825;128 步采样最好,步数降到 32 时 FID 反而更好(28.45)但对齐下滑;独立噪声、独立配对这些设计选择对结果影响很小。
CFG 权重是文生图里被手调了三年的旋钮,多数生产实现至今仍是全局常数。这篇给出的替代方案有两个实际优点:权重按时间步、prompt、当前状态逐个定;推理期只多一个 MLP,零成本。手工调度按模型按数据集重调超参的活,理论上可以省掉。
方法层面的要点在监督信号的来源:密度比有判别器 logit 这个闭式对应,不再依赖固定核的非参数估计。这个思路对其他「学一个采样期控制器」的问题,比如步数调度、噪声调度,应该可以直接迁移。
冷水也要讲清楚:对齐类指标的绝对提升很小。1.05B 模型上 CLIP 与 MMD+SC 基本持平(0.3068 对 0.3067),比常数 CFG 高 0.0005;HPSv2 高 0.0006 到 0.0009;Aesthetic 的 0.03 到 0.05 是最大的 gap。方向一致,幅度是边际的。
论文自述三条:训练复杂,在扩散轨迹上优化对抗博弈需要 TTUR 这类细致调参;骨干绑定,引导网络吃的是特定速度场的几何统计量,换架构要重训,不能 zero-shot 迁移;CLIP 奖励的已知缺陷没有处理,换奖励信号留作未来工作。
读下来还有几处存疑。验证只覆盖自训的 MMDiT-XS/S(不超过 1.05B)加 MS-COCO,没有 SD3、Flux 这类公开旗舰的结果,「随模型规模扩展」的结论建立在两个自训尺寸上。checkpoint 按 3000 张子集的 CLIP 分数挑选,对汇报的 CLIP 指标有选择偏差。FID 恶化被论文描述为 marginal,这个说法只在大模型对常数 CFG 的比较里成立(31.70 对 31.11),对 LIG 的差距接近 7 个点,不算边际。