Relay-OPD 用教师接力修复学生错误前缀推理
zju · hf · 2026-07-29
这篇论文提出 Relay-OPD,用来解决 on-policy distillation 里的 prefix failure:学生一旦在推理前缀里走错方向,后续生成会沿着错误轨迹继续,导致监督失真、算力浪费。
- 方法核心是根据教师与学生在失败前缀上的续写差异,自动触发一个无标签的接力点。
- 训练时让教师在触发点短暂接管,生成一段 relay trajectory,之后再交回学生继续优化。
- 论文强调用有限的接力预算把干预集中在早期关键位置,同时尽量不偏离学生原有策略。
- 在 8 个数学推理基准上,使用 Qwen3-4B-Instruct-2507 做教师、Qwen3-0.6B / 1.7B-Non-Thinking 做学生时,结果是每个基准都达到最优或次优。
- 相比标准 OPD,1.7B 学生平均提升 5.73%;相比最强基线 FastOPD,平均再高 1.49%;训练轨迹长度还减少了 50% 以上。
「研究」频道最新
- 借鉴古法:新框架解决多智能体链「静默失败」 — alizahidrajaa · 2026-07-29
- ISNAD把多智能体链路可信度做到claim级别 — alizahidrajaa · 2026-07-29
- Goodfire 推出块稀疏特征器,称可保留模型推理形状 — bendee983 · 2026-07-29
- MODUS 用单个解码器模型统一任意模态互预测 — EPFL-VILAB · 2026-07-29
- Manski 指出临床统计研究存在系统性方法失灵 — RexDouglass · 2026-07-29
- Kimi K3 常量状态设计让长上下文显存降约 73% — bookwormengr · 2026-07-29