字节 Seed 新论文:扩散模型全程轨迹拿奖励,GPU 训练省 60%
andrew_n_carr · x · 2026-08-29
字节跳动 Seed 团队发布 DiffusionOPSD(On-Policy Self-Distillation in Diffusion Models),解决了扩散模型 RL 训练的核心痛点:传统奖励只在整个图像解码完成后给出,中间去噪步骤得不到监督信号。
方法:
- 冻结的行为策略生成轨迹,提供低噪声查询状态和干净输出锚点;
- 把图像级奖励归一化为奖励上升/下降,在有界的干净输出半径内构造正负目标;
- 可训练策略拟合 detach 的目标,再用 EMA 刷新行为策略,循环迭代。
效果:在 SD3.5-M 和步蒸馏的 Z-Image-Turbo 上做了大量消融,覆盖十个评测器与奖励专项/联合训练设置;在奖励匹配实验中拿到最佳 held-out 分数,且比 DiffusionNFT 少用约 60% 训练 GPU 时。论文与代码均已公开。
「研究」频道最新
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30
- 46 行 Python 实现 SDF 甜甜圈渲染 — voooooogel · 2026-08-30