NeurIPS 2026 论文 Follow the Winners:模仿优胜轨迹替代 PPO/GRPO

lawrennd · x · 2026-10-07

Zhenwen Dai 等人的论文 Follow the Winners 被 NeurIPS 2026 接收。论文提出一种 PPO 和 GRPO 之外的简单 RL 后训练替代方案:从 replay buffer 中采样轨迹,保留「优胜者」并模仿它们,无需 critic,也无需 group rollouts。合作者包括 Joery de Vries 和 Neil Lawrence。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →