iADD 从理论上修正 DDPO:仅更新后段时间步反而损害多样性
Ashok Prasad Neupane · hf · 2026-10-07
这篇论文研究扩散模型的强化学习后训练(如 DDPO),指出现有奖励优化方法牺牲了多样性与质量。
- 数学分析证明:仅对扩散模型后段时间步做更新可能有害于多样性,与此前一项工作的结论相反。
- 提出基于 Feynman-Kac 的增量训练方法,在对齐与多样性之间取得迄今最佳的权衡。
- 在三个任务上与相关扩散策略优化方法对比并做充分消融,验证了对齐与多样性两方面的性能提升。
「多模态」频道最新
- ID-Forcing 方法让自回归视频模型无需微调生成分钟级长视频 — _akhaliq · 2026-10-07
- Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调 — tomaarsen · 2026-10-07
- 嵌入模型任务前缀指南:SearchQuery 配 Document 做检索 — tomaarsen · 2026-10-07
- Matryoshka 训练加持:嵌入维度可裁至 256d 存储省三分之二 — tomaarsen · 2026-10-07
- 斯坦福提出 Level-of-Token DiT:让预训练扩散模型支持任意尺寸 token 网格 — GordonWetzstein · 2026-10-07