OPD 的作用、病理与规制

Rui Wang · hf · 2026-07-17

On-policy distillation 的作用、病理与规制

这篇论文系统研究了 On-Policy Distillation(OPD) 在 LLM 后训练中的作用和失效模式。作者的核心结论是:OPD 更像一种“探索催化剂”,它能通过密集的 token 级指导把学生模型推向正确推理路径,但并不会抬高能力上限。

主要发现

两个病理

规制手段

作者测试了轻量规制方法,包括:

这些方法能缓解长度投机,让蒸馏更稳定。实验覆盖 7 个 benchmark,结果显示规制后的 OPD 持续优于 OPD 变体和 RLVR 基线。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →