Direct-OPD实测:7B模型吸收1.5B策略增量,AIME得分提升6.4%

_lewtun · x · 2026-08-12

本帖提供了 Direct On-Policy Distillation (Direct-OPD) 的论文链接。该研究由清华 AIR 与字节跳动 Seed 联合实验室完成。

文章详细阐述了实验数据:使用 1.5B 模型的 RL 前后检查点作为“教师对”,将其学到的策略变化蒸馏给 7B 的“学生”模型。

实验表明,尽管 7B 模型初始能力(56.7)已强于 1.5B 教师模型 RL 后的能力(51.3),但传统的直接蒸馏反而会使大模型变弱。而采用 Direct-OPD 蒸馏策略增量,能让 7B 模型在 AIME24 上的得分提升至 63.1。

所属事件:清华字节联合提出Direct-OPD策略蒸馏法(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →