MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%

MIT、UMD、Notre Dame 与 UCF 的研究团队(包括 Souradip Chakraborty、Noah Ziems,Omar Khattab 参与)发布 Pedagogical RL 研究,旨在缓解 on-policy 强化学习的采样瓶颈。该方法让模型「学会走运」,实验显示相对 GRPO 最高可提升 40% 的性能表现,为高效强化学习训练提供了新思路。

2026-09-28 ~ 2026-09-28 · 2 条相关