研究者对 pedagogical RL 提出担忧:过度优化学生似然或过滤低概率推理

novasarc01 · x · 2026-09-29

作者认为 pedagogical RL 论文很出色,但担心过度优化 student-likelihood 会使模型趋于保守,过滤掉真正有用但低概率的推理步骤。他建议结合两种思路:先在学生分布支撑附近搜索成功轨迹,再筛选哪些 teacher/token 更新真正值得蒸馏。

所属事件:学者质疑教学法RL:学生似然代理存在盲区(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →