同族在线策略蒸馏的 scaling 规律:小教师也能把 RL 能力传给大模型

zju · hf · 2026-10-01

RL 能让大模型获得显著推理能力,但这种能力如何跨规模迁移、迁移多快,此前不清楚。该论文系统研究在线策略蒸馏(On-Policy Distillation, OPD)在 weak-to-strong、same-base、strong-to-weak 教师-学生组合下的 scaling 性质:

还研究了两种 OPD 变体的 scaling 效应:bootstrapping weak-to-strong OPD,以及 on-policy 监督程度的影响。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →