DuoOPD 双结局策略蒸馏,Qwen3 上较 OPD 提升 5.98 个百分点

Ao Yu · hf · 2026-10-01

在策略蒸馏(OPD)按 token 级反馈训练学生模型,但教师可能答错学生本已答对的题,且两模型在各任务上的成功率分布不同,标准 OPD 会连学生的正确回答一起打压。DuoOPD 引入联合教师-学生结局信号:学生结局决定反馈方向,联合结局决定教师支持方式——仅教师成功时,其验证答案作为评分学生失败回答的上下文;仅学生成功时,以任务内共享权重强化整个回答。单一规则覆盖四种结局组合,无需任务特定设置。

在 Qwen3 和 Llama 上,DuoOPD 在平均宏准确率上超过全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令跟随与代码生成两类任务组合上领先。消融显示仅用结局方向接近门控基线,联合结局设计贡献主要增益。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →