研究者提出 Pedagogical RL:用特权信息主动采样而非盲扫 rollout

lateinteraction · x · 2026-10-03

Souradip Chakraborty 等人提出对现有 RL 训练方式的批评与新思路:典型 RL 算法和 on-policy 蒸馏方法都是「盲采样器」——它们用特权信息(如标准答案、奖励模型)来评分 rollout,却不用它来寻找 rollout。团队据此提出 Pedagogical RL:能否利用特权信息主动采样出 RL 原本只能靠大量算力碰运气才能遇到的 rollout?这一方向有望提升 RL 后训练的样本效率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →