H²SD 把 hindsight 和自蒸馏混合起来改进 RLVR
Qiye Cai · hf · 2026-07-22
H²SD 提出了一种混合式 hindsight self-distillation 方法,想解决 RLVR 里“整条轨迹只有一个标量奖励”导致的稀疏监督和 token 级 credit assignment 问题。
论文先梳理了 RLVR、OPD、OPSD 和 RLSD 的差异:OPD 需要额外 teacher,OPSD 不需要额外 teacher 但可能有信息泄露,RLSD 虽然稳定但缺少显式纠错方向。H²SD 的做法是按轨迹对错分流:成功轨迹用 teacher 的概率去调更新幅度,但方向仍由 reward 决定;失败轨迹则给 teacher 额外的 hint 和正确答案,用 reverse KL 把 student 往正确推。作者在多个 reasoning benchmark 上报告了比这些基线更稳、更好的结果。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27