NYU 提出 RGPO:自适应理由脚手架缓解 RL 奖励稀疏
newyorkuniversity · hf · 2026-10-07
NYU 团队发布 Rationale-Guided Policy Optimization(RGPO),针对 on-policy RL 训练 LLM 推理时的奖励稀疏问题:难题上模型探不出正确轨迹,优化信号枯竭。RGPO 将 ground-truth 理由作为临时脚手架而非固定模仿目标——按模型当前能力自适应提供参考解答帮助生成更优回复,随后只把更高奖励的模型自生成解迁移回无引导的原始设置,因此不要求离策略数据与 RL 任务同格式。在纯语言与视觉-语言推理设置中均稳定超过 RLVR 基线,消融显示自适应引导是关键贡献。
「研究」频道最新
- OpenAI 问题 #109 再收紧:κ 改进约 5.7 亿倍,逼近理论上限 — aran_nayebi · 2026-10-07
- Datology 开源 Zephon:确定性流式 dataloader 解决 GPU 数量不一致难题 — josh_wills · 2026-10-07
- NVIDIA 论文 VERA:让 Agent 框架与模型共同进化,9B 版超出基线 10 分 — omarsar0 · 2026-10-07
- Isomorphic Labs 成 Virtual Biology Initiative 创始成员,开放生物数据 — proteinrosh · 2026-10-07
- MIT 把编码 agent 丢上无人岛 30 小时,研究机器「玩耍」 — phillip_isola · 2026-10-07
- GPT-7「证明」乘法提速 0.0000000000163%,数学家笑了 — jxmnop · 2026-10-07