MIT 等团队提出 Pedagogical RL,相对 GRPO 最高提升 40%

lateinteraction · x · 2026-09-28

Noah Ziems 等人(MIT/UMD/Notre Dame/UCF)发布 Pedagogical RL 研究,回应 on-policy RL 的采样瓶颈。

所属事件:MIT 等团队提出 Pedagogical RL,较 GRPO 最高提升 40%(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →