Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng
cs.CV
2026-08-27
Self-OPD 用学生自己的 SDE 分叉和 ODE 自参照,把终点奖励变成逐步拉-推监督。SD3.5-Medium 上单奖励 GenEval 0.95、OCR 97.5%,混合奖励墙钟约 44–48 小时,约为 DiffusionOPD 的一半。
Flow Matching 已经是高质量视觉生成的主干,要对齐 OCR、构图、审美这类下游目标,仍然别扭。Flow-GRPO 一类 RL 把去噪当成序列决策,奖励来自整条轨迹的终点,信用分配方差大,多目标时不同奖励还互相打架。On-policy distillation(OPD)改成逐步回归教师速度场,稳一些,可每个新目标都要先训一个专项教师,学生被教师质量封顶,多教师在场级别融合还会把更新方向拧反。
清华、浙大和阿里的问题是:OPD 的逐步监督能不能留,外部教师能不能扔。
Self-OPD 在学生自己的轨迹上做局部探索。时刻 $tj$ 先算确定性下一步 $x{t{j+1},\theta}$,再在周围撒 $K$ 条 SDE 候选(实验 $K=8$,$\eta=0.7$)。每条候选用确定性 ODE 滚到干净图,喂给任务奖励。同一父状态再跑一条纯 ODE,当作自参照基线 $r^{\mathrm{ode}}$。分支优势是相对这条基线的标准化差值。
更新用全分支拉-推,不只回归最优分支。优势为正的速度把学生拉过去,为负的推开。方向感知衰减 $dk$ 卡在 $[0,1]$:负分支如果和最优分支几乎同向,斥力会被压掉,避免把拉力抵消。损失按 SDE 转移方差和速度仿射关系归一,对应逐步 reverse KL 的精度项,所以各时间步的尺度不是随便调的超参。时间步权重偏向早中期(定全局布局的阶段),但每个阶段都会见到。
多目标不在参数空间加梯度。各奖励先在分支集合上 z-score,再按任务加权合成标量(OCR 上 $\lambda{\mathrm{OCR}}:\lambda{\mathrm{PickScore}}:\lambda{\mathrm{HPSv2}}=3:1:1$),只用来给分支排序。回归目标始终是已经落在联合高奖励区的那条具体速度,黑盒奖励也能用。
基座是 SD3.5-Medium,512×512,LoRA 训 transformer。对照包括 Flow-GRPO、GRPO-Guard、DiffusionNFT,以及需要教师的 Flow-OPD、DiffusionOPD。
单奖励训练,Self-OPD 报 GenEval 0.95、OCR 97.5%、PickScore 24.79、HPSv2 0.3665,四项都高于同基座、同奖励的 Flow-GRPO 和 GRPO-Guard。混合奖励的单一模型仍是 GenEval 0.95、OCR 96.0%;在同一批 GenEval/OCR 测试图上,PickScore 23.87、HPSv2 0.3214,高于 DiffusionOPD 的 22.72 / 0.2676,也高于 Flow-OPD 的 23.43 / 0.3042。
两种融合的差别写在偏好分布上。DiffusionOPD 从审美提示换到 GenEval/OCR 提示,PickScore 均值下移 1.23、HPSv2 下移 0.105。Self-OPD 两次分布几乎重叠($\Delta=0.48$ / $0.020$),因为分支是在联合高奖励区里选的,不是在参数空间里折中教师梯度。
消融:只回归 Best-of-K 训练不稳,几乎贴着基线;全分支拉-推才稳住;再加上与 $|\Delta t|$ 对齐的 KL 归一,收敛更快。无界斥力 $dk\in[0,2]$ 后期会崩。均匀时间步权重最终能追上,收敛更慢;过度采样早期步的 TIS 反而掉到基座以下。
墙钟:DiffusionOPD 三个教师并行最慢的要 85.8 h,再加 11.3 h 学生,一共 97 h,教师阶段学生闲着。Self-OPD 从零做三奖励,约 62 h 到 OCR 0.946、约 90 h 到 GenEval 0.915。先并行单奖励专家(墙钟 37 h)再混合,OCR 0.946 大约再 11 h、GenEval 0.915 大约再 7 h,总墙钟约 44–48 h,大约快一倍,终点还更高。
做 Flow Matching 对齐的人,可以先别为每个新奖励训教师。逐步监督改由学生自己的邻域探索提供,多目标在奖励层合成,避开场级别的梯度冲突。对要一张图同时过 OCR、构图和审美的产品设置,这篇的「同一测试图」协议比分任务刷分更接近真实目标。
代价是每步要滚 K 条候选再打分,训练算力并不便宜。省下的是教师预训练那几十小时,以及教师天花板。
主表在 HTML 里排版坏了,分方法的逐格数字只能信正文写出的那几项,Flow-GRPO 等基线的完整格子没有可靠转写。实验绑在 SD3.5-Medium、512×512、LoRA 上,有没有泛到 FLUX 或更大分辨率不知道。奖励仍是 OCR / GenEval / PickScore / HPSv2,黑盒可接不代表换成人反馈还稳。K=8 的分叉加 ODE rollout,逐步监督的样本效率优势有多少被探索成本吃回去,没有按 FLOP 对齐的对照。Best-of-K 不稳、无界斥力崩溃,都说明这个目标对超参敏感。没有人类侧评估,也没有报告对基座通用生成的回退。