Pedagogical RL 相对提升最高 40%,MIT 团队教模型「学会走运」
lateinteraction · x · 2026-09-28
MIT、UMD、Notre Dame、UCF 研究者(Souradip Chakraborty、Noah Ziems 等,Omar Khattab 参与)提出 pedagogical RL 新范式,回应 on-policy RL 的采样瓶颈:传统 RL/在线策略蒸馏只把标注答案、执行反馈等特权信息用于评估 rollout,却不用来产生更好的 rollout——模型撞不出成功轨迹时,RL 直接停滞。
核心思路与做法:
- 定义 spike-aware pedagogy reward,RL 训练模型做「自我教师」,生成不仅正确、且每一步都对自身学习有信息量的轨迹
- 用 surprisal-gated imitation 把教师的引导吸收回学生模型
- 直觉:纯 on-policy RL 盲搜成功,pedagogical RL 学会「高效地走运」
实验:在两个推理任务上与 GRPO、on-policy self-distillation 及 off-policy self-distillation 等对比,学习速度显著更快,相对增益最高达 40%。作者称早期结果旨在鼓励社区跳出「只改 on-policy 目标函数」的思路。
所属事件:MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%(2 条相关)→
「漫话AGI」频道最新
- OpenAI 用数千智能体解 Navier-Stokes 难题,数学家忧暴力求解侵蚀艺术性 — nordicinst · 2026-09-28
- 媒体把 AI Agent 拟人化,实为替科技高管逃避法律责任 — JFPuget · 2026-09-28
- 官司对方用 ChatGPT 批量生成八成没读过的质询,逼企业逐一回应 — deepakns · 2026-09-28
- 前沿 AI 落地企业:FDE 用 18 个月实践总结「先做成,再扩张」 — colintjarvis · 2026-09-28
- Beff Jezos讽FLI用Shiba Inu收益资助付费AI末日内容 — beffjezos · 2026-09-28
- 87%企业视AI漏洞为增长最快风险,网络安全入门岗被挤压 — rvp · 2026-09-28