NVIDIA 提出 HDL:用事后分歧定位分支点,RLVR 生成 token 省 2.5 倍
nvidia · hf · 2026-09-30
NVIDIA 提出 Hindsight-Divergence Localization(HDL),改进可验证奖励强化学习(RLVR)的采样效率。方法核心:利用完整轨迹的事后反馈引起 token 对数似然变化,定位模型会「反悔」的关键决策点作为分支位置;每组训练样本由少量完整根轨迹加所选位置的续写构成,续写复用根轨迹前缀、仅用新生成后缀贡献策略更新,把额外探索集中在分支后的决策上。在三个模型、数学/代码/智能体任务上的实验显示:与同组大小、同步数的 GRPO 相比,HDL 生成 token 减少 2.5 倍、rollout 墙钟时间加速 1.8 倍,且三个领域性能均提升,agent 任务最高提升 12.5 分。
「研究」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- 研究者预言神经网络或可分解为演化式符号系统 — QuintinPope5 · 2026-09-30