清华字节联合提出Direct-OPD策略蒸馏法
清华大学AIR与字节跳动Seed联合实验室提出了Direct On-Policy Distillation(Direct-OPD)技术,并在Hugging Face论文俱乐部获得探讨。该方法让小模型进行强化学习,大模型直接吸收其策略增量,从而以极低算力实现从弱到强的泛化。实测显示,7B大模型吸收1.5B模型的策略增量后,其AIME得分显著提升了6.4%。
2026-08-12 ~ 2026-08-12 · 3 条相关
- HF论文导读:在策略蒸馏法,极低算力实现弱到强泛化 — Hugging Face · 2026-08-12
- 清华字节提出Direct-OPD:小模型做RL,大模型直接吃透策略增量 — _lewtun · 2026-08-12
- Direct-OPD实测:7B模型吸收1.5B策略增量,AIME得分提升6.4% — _lewtun · 2026-08-12