dOPSD: A New Self-Distillation Paradigm for Diffusion LLMs

Institutions including MPI and Tsinghua introduced dOPSD, an on-policy self-distillation method for Diffusion LLMs. By using internal denoising trajectories as training signals, it enhances reasoning without relying on reference solutions.

2026-07-07 ~ 2026-07-09 · 2 related posts