On-Policy Self-Distillation:自蒸馏方法比 GRPO 省 4-8 倍 token
burny_tech · x · 2026-09-13
UCLA、HKU 与 Meta 研究者(一作 Siyan Zhao)提出 On-Policy Self-Distillation(自策略自蒸馏):让 LLM 在有特权信息(如正确答案或推理轨迹)条件下,对自己没有该信息的弱版本做逐 token 密集监督,相当于学生复习答案并纠正错误。
- 效率:相比 GRPO 达到 4-8 倍 token 效率,成绩同时超过 GRPO 与 SFT/Off-Policy Distillation
- 动机:SFT 有 exposure bias,训练分布与自回归生成不匹配易致错误累积;GRPO 需每题多次 rollout 且只有稀疏序列级反馈,全对全错时梯度消失
- 已发布博客、论文与代码
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14