DiffusionOPSD:扩散模型中的策略自蒸馏

ByteDance-Seed · hf · 2026-08-26

字节跳动提出 DiffusionOPSD,利用策略自蒸馏将图像级奖励转化为扩散模型的显式中间目标。该方法提高了对齐效率,并允许对目标构建和策略拟合进行单独分析。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →