Direct-OPD实测:7B模型吸收1.5B策略增量,AIME得分提升6.4%
_lewtun · x · 2026-08-12
本帖提供了 Direct On-Policy Distillation (Direct-OPD) 的论文链接。该研究由清华 AIR 与字节跳动 Seed 联合实验室完成。
文章详细阐述了实验数据:使用 1.5B 模型的 RL 前后检查点作为“教师对”,将其学到的策略变化蒸馏给 7B 的“学生”模型。
实验表明,尽管 7B 模型初始能力(56.7)已强于 1.5B 教师模型 RL 后的能力(51.3),但传统的直接蒸馏反而会使大模型变弱。而采用 Direct-OPD 蒸馏策略增量,能让 7B 模型在 AIME24 上的得分提升至 63.1。
所属事件:清华字节联合提出Direct-OPD策略蒸馏法(3 条相关)→
「研究」频道最新
- 推出 ContextBench:面向上下文工程的 LeetCode 练习场 — Final_Act_9658 · 2026-08-12
- OpenAI发布企业AI采用报告:覆盖1500家企业与1700万条消息 — soumitrashukla9 · 2026-08-12
- 企业AI鸿沟加剧:头部与中腰部Token使用量差距扩大3倍 — soumitrashukla9 · 2026-08-12
- 探讨LLM递归自我改进:当前RSI定义框架是否合理? — willccbb · 2026-08-12
- 无需标签与教师模型,u-OPSD 自蒸馏法大幅提升 LLM 数学推理 — burny_tech · 2026-08-12
- 长文综述150+智能体记忆架构:自演进设计提升50%长程记忆 — blaizedsouza · 2026-08-12