DiffusionOPSD Cuts Diffusion Model Training Compute by 63%

ByteDance's DiffusionOPSD uses on-policy self-distillation to turn image-level rewards into explicit intermediate targets, cutting diffusion model training compute by 63% while improving alignment efficiency.

2026-08-26 ~ 2026-08-28 · 2 related posts