研究发现策略蒸馏主要传递推理行为而非答案
teortaxesTex · x · 2026-08-30
该论文深入研究了 On-Policy Distillation (OPD) 的实际传递机制。主要发现包括:
- 训练难度影响微弱:即使教师模型从未解决过的问题,也能为学生模型提供有用的监督。这表明 OPD 主要传递的是教师的“推理行为”而非特定问题的答案。
- 模型来源至关重要:同源(Same-origin)的师生对在跨语言、跨推理步长甚至跨领域的泛化能力上表现优异;而跨源的强教师模型往往传递效果较差。
- 多教师混合的副作用:在多教师 OPD 中,试图将 Prompt 路由给领域专家并不能隔离其影响。改变教师的混合比例会导致学生模型的能力在不同教师间“跷跷板”式摆动,而非简单的技能叠加。
所属事件:研究称策略蒸馏传递推理行为 同源弱师胜异源强师(3 条相关)→
「研究」频道最新
- 强模型给弱模型搭脚手架:不训练小模型,准确率近乎翻倍 — 机器之心 · 2026-08-30
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30