NVIDIA 提出 HDL:用事后分歧定位分支点,RLVR 生成 token 省 2.5 倍

nvidia · hf · 2026-09-30

NVIDIA 提出 Hindsight-Divergence Localization(HDL),改进可验证奖励强化学习(RLVR)的采样效率。方法核心:利用完整轨迹的事后反馈引起 token 对数似然变化,定位模型会「反悔」的关键决策点作为分支位置;每组训练样本由少量完整根轨迹加所选位置的续写构成,续写复用根轨迹前缀、仅用新生成后缀贡献策略更新,把额外探索集中在分支后的决策上。在三个模型、数学/代码/智能体任务上的实验显示:与同组大小、同步数的 GRPO 相比,HDL 生成 token 减少 2.5 倍、rollout 墙钟时间加速 1.8 倍,且三个领域性能均提升,agent 任务最高提升 12.5 分。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →