On-Policy Self-Distillation:自蒸馏方法比 GRPO 省 4-8 倍 token

burny_tech · x · 2026-09-13

UCLA、HKU 与 Meta 研究者(一作 Siyan Zhao)提出 On-Policy Self-Distillation(自策略自蒸馏):让 LLM 在有特权信息(如正确答案或推理轨迹)条件下,对自己没有该信息的弱版本做逐 token 密集监督,相当于学生复习答案并纠正错误。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →