DuoOPD 双结局策略蒸馏,Qwen3 上较 OPD 提升 5.98 个百分点
Ao Yu · hf · 2026-10-01
在策略蒸馏(OPD)按 token 级反馈训练学生模型,但教师可能答错学生本已答对的题,且两模型在各任务上的成功率分布不同,标准 OPD 会连学生的正确回答一起打压。DuoOPD 引入联合教师-学生结局信号:学生结局决定反馈方向,联合结局决定教师支持方式——仅教师成功时,其验证答案作为评分学生失败回答的上下文;仅学生成功时,以任务内共享权重强化整个回答。单一规则覆盖四种结局组合,无需任务特定设置。
在 Qwen3 和 Llama 上,DuoOPD 在平均宏准确率上超过全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令跟随与代码生成两类任务组合上领先。消融显示仅用结局方向接近门控基线,联合结局设计贡献主要增益。
「研究」频道最新
- Nature Genetics 论文发布 ArchMap:免代码单细胞数据比对参考图谱平台 — burny_tech · 2026-10-01
- arXiv 新论文:用世界文学方法构建有文化素养的 AI — begusgasper · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- KV-streams 方法让 SWE Agent 训练提速 2 倍且不掉点 — burny_tech · 2026-10-01
- 用「自我」替代「人格」?模型心理学术语之争引热议 — repligate · 2026-10-01
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01