字节 Seed 新论文:扩散模型全程轨迹拿奖励,GPU 训练省 60%

andrew_n_carr · x · 2026-08-29

字节跳动 Seed 团队发布 DiffusionOPSD(On-Policy Self-Distillation in Diffusion Models),解决了扩散模型 RL 训练的核心痛点:传统奖励只在整个图像解码完成后给出,中间去噪步骤得不到监督信号。

方法:

效果:在 SD3.5-M 和步蒸馏的 Z-Image-Turbo 上做了大量消融,覆盖十个评测器与奖励专项/联合训练设置;在奖励匹配实验中拿到最佳 held-out 分数,且比 DiffusionNFT 少用约 60% 训练 GPU 时。论文与代码均已公开。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →