dOPSD: A New Self-Distillation Paradigm for Diffusion LLMs
Institutions including MPI and Tsinghua introduced dOPSD, an on-policy self-distillation method for Diffusion LLMs. By using internal denoising trajectories as training signals, it enhances reasoning without relying on reference solutions.
2026-07-07 ~ 2026-07-09 · 2 related posts
- dOPSD: Online Self-Distillation for Enhanced Diffusion LLM Inference — Phuong Tuan Dat · 2026-07-07
- New Self-Distillation Paradigm for Diffusion LLMs — 机器之心 · 2026-07-09