H²SD 把 hindsight 和自蒸馏混合起来改进 RLVR

Qiye Cai · hf · 2026-07-22

H²SD 提出了一种混合式 hindsight self-distillation 方法,想解决 RLVR 里“整条轨迹只有一个标量奖励”导致的稀疏监督和 token 级 credit assignment 问题。

论文先梳理了 RLVR、OPD、OPSD 和 RLSD 的差异:OPD 需要额外 teacher,OPSD 不需要额外 teacher 但可能有信息泄露,RLSD 虽然稳定但缺少显式纠错方向。H²SD 的做法是按轨迹对错分流:成功轨迹用 teacher 的概率去调更新幅度,但方向仍由 reward 决定;失败轨迹则给 teacher 额外的 hint 和正确答案,用 reverse KL 把 student 往正确推。作者在多个 reasoning benchmark 上报告了比这些基线更稳、更好的结果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →