NeurIPS 2026 论文 Follow the Winners:模仿优胜轨迹替代 PPO/GRPO
lawrennd · x · 2026-10-07
Zhenwen Dai 等人的论文 Follow the Winners 被 NeurIPS 2026 接收。论文提出一种 PPO 和 GRPO 之外的简单 RL 后训练替代方案:从 replay buffer 中采样轨迹,保留「优胜者」并模仿它们,无需 critic,也无需 group rollouts。合作者包括 Joery de Vries 和 Neil Lawrence。
「研究」频道最新
- HAIPS@COLM 2026 工作坊聚焦语言模型的人本隐私与安全 — tianshi_li · 2026-10-07
- 为什么有些句子更好记?研究称「含义独特性」是关键预测因素 — GretaTuckute · 2026-10-07
- CUAWright 论文:只用终端命令,computer-use agent 胜过 GUI 方案 — ysu_nlp · 2026-10-07
- AI 年度十佳论文揭晓:Rulin Shao 一人独占两篇,皆为一作 — ShayneRedford · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Paradigm 揭秘后训练关键:程序生成+LLM 出题的互补合成数据组合 — tensorqt · 2026-10-07