RL 依然有效:非可验证任务中 GRPO 表现最佳

auto_grad_ · x · 2026-07-30

开发者在处理非可验证(non-verifiable)任务时,对比测试了 SDPO、OPSPO 和 GRPO 三种强化学习方法。实验结果表明,GRPO 取得了最好的 checkpoint 效果,再次印证了强化学习在特定场景下的有效性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →