Pedagogical RL 相对提升最高 40%,MIT 团队教模型「学会走运」

lateinteraction · x · 2026-09-28

MIT、UMD、Notre Dame、UCF 研究者(Souradip Chakraborty、Noah Ziems 等,Omar Khattab 参与)提出 pedagogical RL 新范式,回应 on-policy RL 的采样瓶颈:传统 RL/在线策略蒸馏只把标注答案、执行反馈等特权信息用于评估 rollout,却不用来产生更好的 rollout——模型撞不出成功轨迹时,RL 直接停滞。

核心思路与做法:

实验:在两个推理任务上与 GRPO、on-policy self-distillation 及 off-policy self-distillation 等对比,学习速度显著更快,相对增益最高达 40%。作者称早期结果旨在鼓励社区跳出「只改 on-policy 目标函数」的思路。

所属事件:MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →