清华字节提出Direct-OPD:小模型做RL,大模型直接吃透策略增量
_lewtun · x · 2026-08-12
Hugging Face 论文俱乐部讨论了来自清华与字节跳动联合团队的 Direct On-Policy Distillation (Direct-OPD) 技术。
该方法旨在解决大模型强化学习(RL)成本过高的问题。其核心思路是:先在小模型上进行昂贵的 RL 训练,然后提取小模型在 RL 前后的策略变化(policy shift),并将其蒸馏给原本就更强的大模型。
相比直接蒸馏小模型(会继承其能力缺陷),这种提取“RL 增量”的方法效果显著。在 AIME24 测试中,7B 大模型吸收 1.5B 小模型的策略增量后,得分从 56.7 提升至 63.1。
所属事件:清华字节联合提出Direct-OPD策略蒸馏法(3 条相关)→
「研究」频道最新
- 推出 ContextBench:面向上下文工程的 LeetCode 练习场 — Final_Act_9658 · 2026-08-12
- OpenAI发布企业AI采用报告:覆盖1500家企业与1700万条消息 — soumitrashukla9 · 2026-08-12
- 企业AI鸿沟加剧:头部与中腰部Token使用量差距扩大3倍 — soumitrashukla9 · 2026-08-12
- 探讨LLM递归自我改进:当前RSI定义框架是否合理? — willccbb · 2026-08-12
- 无需标签与教师模型,u-OPSD 自蒸馏法大幅提升 LLM 数学推理 — burny_tech · 2026-08-12
- 长文综述150+智能体记忆架构:自演进设计提升50%长程记忆 — blaizedsouza · 2026-08-12