NYU 提出 RGPO:自适应理由脚手架缓解 RL 奖励稀疏

newyorkuniversity · hf · 2026-10-07

NYU 团队发布 Rationale-Guided Policy Optimization(RGPO),针对 on-policy RL 训练 LLM 推理时的奖励稀疏问题:难题上模型探不出正确轨迹,优化信号枯竭。RGPO 将 ground-truth 理由作为临时脚手架而非固定模仿目标——按模型当前能力自适应提供参考解答帮助生成更优回复,随后只把更高奖励的模型自生成解迁移回无引导的原始设置,因此不要求离策略数据与 RL 任务同格式。在纯语言与视觉-语言推理设置中均稳定超过 RLVR 基线,消融显示自适应引导是关键贡献。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →