Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang
cs.CV, cs.AI, cs.LG
2026-07-28
扩散策略蒸馏里直接匹配 CFG 合成速度会让正负分支误差互相抵消;PDM 改成分支感知匹配,让视频控制对推理引导强度不再敏感。
扩散模型用教师蒸馏学生时,on-policy distillation(OPD,让学生沿自己生成的轨迹去查询教师)是常用做法。但现代扩散系统都开 classifier-free guidance(CFG),而现有 OPD 方法直接拿学生和教师的「CFG 合成后速度」去匹配。这篇指出这个目标在分支层面是欠定的:CFG 由正向条件分支和负向(无条件)分支合成,两个分支的误差可以在合成预测里互相补偿,合成值没变但分支各自一塌糊涂。
论文先给这个病一个名字。当教师的负分支带着学生拿不到的「特权信息」(比如教师看到参考图、学生看不到),朴素的合成匹配会出现负分支不对称(Negative Branch Asymmetry, NBA),正分支误差在降、负分支误差反而在涨,两者对抗。这在「共享负条件」(师生负分支都是空文本)时不会发生,朴素匹配依然有效。
文章用两个对照案例说清:文本渲染蒸馏(SD3.5-Medium,负条件共享)里朴素匹配没问题;参考条件蒸馏(FLUX.2-klein-4B,教师负分支含参考图)里 NBA 出现。诊断信号是当推理引导强度 γ 偏离训练值,尤其 γ=1(CFG 退化成正分支)时,教师学生差距骤增。
解法是 Positive-Direction Matching(PDM):不再只卡合成预测,而是分别约束正分支预测本身、以及 CFG 条件方向(正负分支速度之差)。
| 目标 | 约束对象 |
| 朴素匹配 | 合成预测 γe₊+(1-γ)e₋ |
| IBM(独立分支) | 正负分支各自 |
| PDM(本文) | 正分支 + 条件方向 |
用在密集控制到稀疏控制的视频控制(Wan-VACE,480×832,81 帧),教师每帧给密集控制信号,学生只在第 0/20/40/60 帧拿到关键帧。γ=5:
| 任务(全体帧) | 教师 | 朴素 | PDM |
| 姿态 MPJPE↓ | 3.03 | 4.43 | 4.13 |
| 深度 RMSE↓ | 7.50 | 12.39 | 11.95 |
| 涂鸦 F1↑ | 93.73 | 75.00 | 76.22 |
更关键的是引导强度的鲁棒性。姿态任务在 γ=5 训练、γ=1 测:朴素 MPJPE 飙到 8.98、FID 78.20,PDM 只有 4.48、FID 15.25。朴素方法对推理引导高度敏感,PDM 把这个敏感性基本压下去。在共享负条件的文本渲染上 PDM 和朴素差不多(本来就有效),说明 PDM 是在 NBA 场景里救场,不伤好场景。
CFG 是几乎所有现代扩散模型的默认件,但「在 CFG 下怎么做蒸馏」此前基本是个盲区,大家默认拿合成速度一匹配了事。这篇把盲区点破并给了便宜可用的修正,对做视频控制、图生视频蒸馏的工程团队有直接价值:PDM 只改损失函数不动架构,只监督 8 个状态(K=8)就把每步训练从约 790 秒压到 132 秒。
作者坦白:PDM 和 IBM 在非退化权重下共享同一个分支级零损失解,PDM 的优势目前是经验性的,还没有理论解释两者优化行为的差异。NBA 的分析只覆盖 CFG 这一种引导机制,其他引导方式没扩展。深度控制那栏(PDM 11.95 vs 朴素 12.39)提升很小,说明并非所有控制模态都同样受益。