MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%
MIT、UMD、Notre Dame 与 UCF 的研究团队(包括 Souradip Chakraborty、Noah Ziems,Omar Khattab 参与)发布 Pedagogical RL 研究,旨在缓解 on-policy 强化学习的采样瓶颈。该方法让模型「学会走运」,实验显示相对 GRPO 最高可提升 40% 的性能表现,为高效强化学习训练提供了新思路。
2026-09-28 ~ 2026-09-28 · 2 条相关
- Pedagogical RL 相对提升最高 40%,MIT 团队教模型「学会走运」 — lateinteraction · 2026-09-28
- MIT 等团队提出 Pedagogical RL,相对 GRPO 最高提升 40% — lateinteraction · 2026-09-28