MIT 等团队提出 Pedagogical RL,相对 GRPO 最高提升 40%
lateinteraction · x · 2026-09-28
Noah Ziems 等人(MIT/UMD/Notre Dame/UCF)发布 Pedagogical RL 研究,回应 on-policy RL 的采样瓶颈。
- 核心问题:典型 RL 与 on-policy 蒸馏依赖有标签答案或执行反馈来评估 rollout,却无法利用这些特权信息寻找好的 rollout——模型若碰不到成功轨迹,RL 就停滞。
- 方法:提出 spike-aware pedagogy reward,让模型作为「自我教师」通过 RL 学会生成不仅正确、而且每一步都对自身学习有用处的轨迹;再经 surprisal-gated imitation 吸收这些教学指导。
- 结果:在两个推理任务上对比 GRPO、on-policy/off-policy 自蒸馏等方法,Pedagogical RL 学习快得多,相对增益最高达 40%。
- 主张:纯 on-policy 的「盲目试对」正成为瓶颈,应探索利用特权信息让采样「更幸运」的新范式。作者 lateinteraction 也指出这摆脱了 guess-and-check 算法尴尬的 on-policy 限制。
所属事件:MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%(2 条相关)→
「研究」频道最新
- 推理工程档案上线:从第一性原理到生产环境的完整学习资源 — soham_btw · 2026-09-28
- OpenAI 用数千智能体解 Navier-Stokes 难题,数学家忧暴力求解侵蚀艺术性 — nordicinst · 2026-09-28
- 东京大学用人体细胞培养活体皮肤包裹机械手指,可自愈 — TinfoilTricorn · 2026-09-28
- Thales 用扩散模型修卫星测绘高程图,城市 RMSE 从 6 米降到 3.45 米 — thalesgroup · 2026-09-28
- Stanford 开源 HomeBody:给前沿 VLM 装上空间记忆与人形技能库 — CyberRobooo · 2026-09-28
- MOPC 能去掉 OPSD 的自教缺陷,但多教师平均可能蒸馏出风格而非能力 — novasarc01 · 2026-09-28