新方法 DiffusionOPSD 将扩散模型训练算力削减 63%

burny_tech · x · 2026-08-28

论文《On-Policy Self-Distillation in Diffusion Models》提出 DiffusionOPSD 方法,旨在解决扩散强化学习仅在最终图像给予奖励的低效问题。该方法将端点奖励转化为模型中间状态上的显式奖励改进目标,并通过策略内自蒸馏将目标回流至模型。实验显示,在两种扩散骨干和十个评估器中,DiffusionOPSD 在 20 个设置中的 19 个里取得了最佳保留分数,同时将训练 GPU 小时数减少了多达 63%。核心思想是将扩散对齐视为带有直接中间监督的连续自蒸馏过程。

所属事件:字节提出 DiffusionOPSD 大幅降低扩散模型训练算力(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →