新论文提出 OPRD:弱教师反向蒸馏让学生模型超越教师上限
algo_diver · x · 2026-09-10
arXiv 论文《Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation》(Aaron Courville 等参与)研究弱到强泛化:新模型代际更替时,能否不从零重训,而是利用旧弱模型加速训练出更强的继任者。
核心方法 On-Policy Reverse Distillation (OPRD):
- 不把弱教师当作优化目标(传统蒸馏会把教师能力天花板强加给学生),而是衡量教师策略相对其参考策略的偏移方向(Delta),在学生 rollout 上评估该方向;
- 只放大学生策略梯度中由验证器(verifier)支持、且与教师偏移方向一致的分量,从而保留策略优化的驻点,同时加速学习超越教师;
- 结论:在连续代际迁移与多教师蒸馏两种场景下,OPRD 用更少的学生更新次数取得高于现有 RL 与蒸馏方法的性能;响应风格分析显示学生更接近纯 verifier-RL 训练的模型,说明教师只是加速而非改变学生自身的优化方向。
所属事件:新论文提出 OPRD:在线反向蒸馏实现弱到强泛化(2 条相关)→
「模型」频道最新
- DeepSeek V4.1 Flash 再改 Transformer:回走编解码结构、CSA2 跨层复用 — evijit · 2026-09-10
- DeepSeek 回归 encoder-decoder 架构,新架构改动全面开源 — evijit · 2026-09-10
- 1 亿输出 token 仅 60 美元:DeepSeek 峰谷定价碾压 Opus 5 — airesearch12 · 2026-09-10
- Bug Hunt Bench 用 105 个真实埋入 Bug 排名前沿编程模型 — PawelHuryn · 2026-09-10
- 同时订阅 Claude 与 ChatGPT 仍撞限额,20 美元档跳 100 美元被吐槽 — MaxLenormand · 2026-09-10
- 爆料:DeepSeek 曾训练 3T 参数模型,因经济性暂缓发布 — zephyr_z9 · 2026-09-10