清华字节提出Direct-OPD:小模型做RL,大模型直接吃透策略增量

_lewtun · x · 2026-08-12

Hugging Face 论文俱乐部讨论了来自清华与字节跳动联合团队的 Direct On-Policy Distillation (Direct-OPD) 技术。

该方法旨在解决大模型强化学习(RL)成本过高的问题。其核心思路是:先在小模型上进行昂贵的 RL 训练,然后提取小模型在 RL 前后的策略变化(policy shift),并将其蒸馏给原本就更强的大模型。

相比直接蒸馏小模型(会继承其能力缺陷),这种提取“RL 增量”的方法效果显著。在 AIME24 测试中,7B 大模型吸收 1.5B 小模型的策略增量后,得分从 56.7 提升至 63.1。

所属事件:清华字节联合提出Direct-OPD策略蒸馏法(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →