RL 盲采样低效论:特权信息应主动采样而非仅打分

lateinteraction · x · 2026-09-07

这是关于 Pedagogical RL 的技术讨论。原帖提出:典型 RL 算法和 on-policy 蒸馏是「盲采样器」——只用特权信息给 rollout 打分,而不用它去寻找有用的 rollout。转发者补充指出,SDPO 失效正是可以预测的结果:它并未用特权信息去发现成功 rollout,只用于重新打分;当特权信息熵很高(意外性强)时,指望随机撞出成功 rollout 几乎不可能。核心主张是用特权信息主动采样出 RL 想要却难以偶然得到的 rollout。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →