Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu
cs.CV
2026-08-05
FLUX 美感强、Z-Image 构图准,但 VAE 与噪声调度不同没法直接蒸。Poly-OPD 用像素桥接加 DINOv2 空间做异构蒸馏,2.5B 学生 GenEval 73.3 反超两个大教师。
开源文生图模型各有专长:FLUX.1-dev 美感、偏好对齐强,Z-Image 跟指令构图(数量、位置、颜色、属性)更准。这两种能力很少共存于一个 checkpoint,而这两个专家架构异构,VAE、去噪器、噪声调度都不一样。标准蒸馏(score 或 trajectory matching)要求师生共享 VAE 和噪声调度,异构教师一个都不沾,它的潜空间和去噪轨迹对学生不是合法目标。退而求其次用教师生成的图来训又是 off-policy,训练和推理不一致卡住了保真度。再加两种能力蒸进一个网络会互相干扰,构图子技能又冷热不均。
学生是 SD3.5-Medium(2.5B)的 flow matching 模型,教师是 FLUX.1-dev(12B,偏好美感模式)和 Z-Image(6B,构图模式),都冻结。三块机制。
像素桥(异构 on-policy 蒸馏)。学生先无梯度采自己的样本,解码到像素(唯一共同的坐标系),用当前教师的 VAE 重新编码,按「幅值」匹配噪声等级(不是时间步索引,因为调度不同)重加噪,让冻结教师精修最后 r 步。精修后的图是「教师对学生自己输出的修正」,是个来自原本读不懂的教师的 on-policy 目标。监督在冻结的 DINOv2 CLS 特征空间里做余弦 loss,不在任何潜空间,DINOv2 对模型特定的像素统计不敏感,跨模型比较才成立。分两阶段:先用教师样本 off-policy 暖启动把学生拉到教师分布附近,再做 on-policy 蒸馏收尾。
梯度兼容性诊断(可切能力的 adapter)。不靠猜,直接量偏好模式和构图模式 LoRA 梯度的平均余弦相似度(1000 对样本)。结果:注意力梯度在两种模式下保持对齐(可共享),FFN 梯度在好几个 block 冲突变负。于是设计被测量定下来:所有教师共享一个注意力 LoRA,每个能力各自独立的 FFN adapter。骨干冻结只训 LoRA,切能力只是换 adapter,不是换第二个模型。
缺口感知课程。在构图模式内按「教师减学生剩余差距」而不是原始难度分配提示,差距收窄后权重自动衰减归零。
GenEval 上 2.5B 学生从 67.3 到 73.3,超过两个大教师(Z-Image 69.4、FLUX 65.2);DrawBench HPSv3 从 9.34 到 11.35。各子项里,双物体从 82.07 到 97.00、属性从 58.75 到 67.00(超过两个教师的 52.80 和 44.30),学生没被教师的单项上限卡住。
| 指标 | SD3.5-M | FLUX | Z-Image | Poly-OPD |
| GenEval | 67.3 | 65.2 | 69.4 | 73.3 |
| DrawBench HPSv3 | 9.34 | 11.93 | 9.08 | 11.35 |
| ImageReward | 0.92 | 0.92 | 0.83 | 1.17 |
要诚实:DrawBench HPSv3 上学生 11.35 仍低于 FLUX 的 11.93,大概追回了 78% 的差距;ImageReward 和对齐子项上反超 FLUX。消融里去掉暖启动 GenEval 直接崩到 49.2(降 24.1),暖启动是刚需;去掉可切能力 adapter 掉 11 个 GenEval 点;感知空间换成 SigLIP 或 ConvNeXt,GenEval 掉约 7 个点,直接用学生潜空间 MSE 则彻底崩。
对做 T2I 蒸馏的人来说,「异构教师没法直接蒸」是个长期痛点,像素桥加 DINOv2 空间给了个干净解法,且切能力只需换 adapter、参数亚线性增长,工程上划算。梯度诊断决定哪些参数共享、哪些隔离,是个可推广的做法,不靠拍脑袋。
论文没有独立的局限章节。只用了 2 个教师演示,方法号称能扩到多个模式但没验证;学生只测了 SD3.5-Medium 一种骨架。像素桥每步要一次学生 rollout 加 r 步教师精修再加反向,成本不低,但全文没给 FLOPs 或 GPU 时长,实际部署比直接跑 FLUX 划不划算没法判断。暖启动是必需的,不是零样本方法。只在 512 乘 512 评测,没有更高分辨率或宽高比。计数子项几乎没动(GenEval 计数 59.06 到 59.90,低于两个教师),构图提升不均衡。全靠自动指标,没有人类偏好研究。DPG-Bench 均值 85.80 仍比 Z-Image 教师的 86.08 低 0.28,不是每个 benchmark 都赢教师。顺带说明,作者单位写的是 Joy Future Academy(浙大、北航合作),联系邮箱是 jd.com,别直接当成京东出品。