iADD 从理论上修正 DDPO:仅更新后段时间步反而损害多样性

Ashok Prasad Neupane · hf · 2026-10-07

这篇论文研究扩散模型的强化学习后训练(如 DDPO),指出现有奖励优化方法牺牲了多样性与质量。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →