新方法 DiffusionOPSD 将扩散模型训练算力削减 63%
burny_tech · x · 2026-08-28
论文《On-Policy Self-Distillation in Diffusion Models》提出 DiffusionOPSD 方法,旨在解决扩散强化学习仅在最终图像给予奖励的低效问题。该方法将端点奖励转化为模型中间状态上的显式奖励改进目标,并通过策略内自蒸馏将目标回流至模型。实验显示,在两种扩散骨干和十个评估器中,DiffusionOPSD 在 20 个设置中的 19 个里取得了最佳保留分数,同时将训练 GPU 小时数减少了多达 63%。核心思想是将扩散对齐视为带有直接中间监督的连续自蒸馏过程。
所属事件:字节提出 DiffusionOPSD 大幅降低扩散模型训练算力(2 条相关)→
「Infra」频道最新
- 反垄断担忧:英伟达暂停部分云厂商收入分成协议 — rohanpaul_ai · 2026-08-28
- InferCrane:自托管模型的生产级部署与回滚平台 — yasintoy · 2026-08-28
- 日烧 2500 美元后的教训:主动规避昂贵且低效的 AI 调用 — zeeg · 2026-08-28
- 开发者爆料:近期 Token 消费年化达 500 万美元 — LukeParkerDev · 2026-08-28
- Ramp Router 上线:LLM 网关降低推理成本 40% — SethGRosenberg · 2026-08-28
- OpenAI Jalapeño 推理芯片深度解析 — thehiphopswami · 2026-08-28