H²SD 把 hindsight 和自蒸馏混合起来改进 RLVR
Qiye Cai · hf · 2026-07-22
H²SD 提出了一种混合式 hindsight self-distillation 方法,想解决 RLVR 里“整条轨迹只有一个标量奖励”导致的稀疏监督和 token 级 credit assignment 问题。
论文先梳理了 RLVR、OPD、OPSD 和 RLSD 的差异:OPD 需要额外 teacher,OPSD 不需要额外 teacher 但可能有信息泄露,RLSD 虽然稳定但缺少显式纠错方向。H²SD 的做法是按轨迹对错分流:成功轨迹用 teacher 的概率去调更新幅度,但方向仍由 reward 决定;失败轨迹则给 teacher 额外的 hint 和正确答案,用 reverse KL 把 student 往正确推。作者在多个 reasoning benchmark 上报告了比这些基线更稳、更好的结果。
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11