同族在线策略蒸馏的 scaling 规律:小教师也能把 RL 能力传给大模型
zju · hf · 2026-10-01
RL 能让大模型获得显著推理能力,但这种能力如何跨规模迁移、迁移多快,此前不清楚。该论文系统研究在线策略蒸馏(On-Policy Distillation, OPD)在 weak-to-strong、same-base、strong-to-weak 教师-学生组合下的 scaling 性质:
- useful-transfer 规律:训练早期,holdout 准确率(gold score G)随学生相对参考模型的 token 级 reverse KL 平方根近似线性上升,该规律在各种组合中一致成立
- weak-to-strong:所有观测组合中,学生的峰值 gold score 都超过教师本身——紧凑的 RL 专家可以通过 OPD 把能力传给大得多的学生
- 幂律拟合:Gpeak 与迁移斜率随学生/教师参数量及教师 gold score 满足幂律;教师规模超过学生规模后收益趋平;同等 gold score 下,更小的教师迁移效果更好——教师自身分数并不能定义其监督价值
还研究了两种 OPD 变体的 scaling 效应:bootstrapping weak-to-strong OPD,以及 on-policy 监督程度的影响。
「研究」频道最新
- HCOMP 2026 末场聚焦:跨线上与物理环境的错误信息信念研究 — windx0303 · 2026-10-01
- Meta-Reasoning 论文:把执行策略纳入推理,ProgramBench 上超 Codex 13.5 分 — anirudhg9119 · 2026-10-01
- 推理时扩展新思路:关键不是算多少,而是怎么组织计算 — anirudhg9119 · 2026-10-01
- Meta 团队提出 Agentic Meta-Reasoning:让模型自建推理计算图 — anirudhg9119 · 2026-10-01
- FINGR 灵巧手用连续手指动作复原二阶魔方 — HaozhiQ · 2026-10-01
- 19和21维接触数下界刷新:τ₁₉≥12268、τ₂₁≥30761 — felpix_ · 2026-10-01