研究称同策略蒸馏靠抑制低概率 Token 而非教师指导

论文《Does On-Policy Distillation Really Distill?》探讨了同策略蒸馏的实际机制。研究发现,其推理能力提升并非来自教师模型的有意义指导,收益主要源于抑制学生模型采样中的低概率 Token,这意味着模型在无教师的情况下也可通过类似机制实现自我改进。

2026-09-01 ~ 2026-09-02 · 2 条相关