字节提出 DiffusionOPSD 大幅降低扩散模型训练算力

字节跳动在论文《On-Policy Self-Distillation in Diffusion Models》中提出 DiffusionOPSD 方法,通过策略自蒸馏将图像级奖励转化为扩散模型的显式中间目标,解决扩散强化学习仅在最终图像给予奖励导致对齐效率低的问题。该方法将对齐算力需求削减 63%,并允许对目标构建和策略拟合进行单独分析,提升了模型对齐效率。

2026-08-26 ~ 2026-08-28 · 2 条相关