Study: On-Policy Distillation Works by Suppressing Low-Probability Tokens

A paper examining on-policy distillation finds its gains come mainly from suppressing low-probability tokens in the student's sampling rather than meaningful teacher guidance, suggesting models can self-improve without a teacher.

2026-09-01 ~ 2026-09-02 · 2 related posts