清华字节联合提出Direct-OPD策略蒸馏法

清华大学AIR与字节跳动Seed联合实验室提出了Direct On-Policy Distillation(Direct-OPD)技术,并在Hugging Face论文俱乐部获得探讨。该方法让小模型进行强化学习,大模型直接吸收其策略增量,从而以极低算力实现从弱到强的泛化。实测显示,7B大模型吸收1.5B模型的策略增量后,其AIME得分显著提升了6.4%。

2026-08-12 ~ 2026-08-12 · 3 条相关