研究者对 pedagogical RL 提出担忧:过度优化学生似然或过滤低概率推理
novasarc01 · x · 2026-09-29
作者认为 pedagogical RL 论文很出色,但担心过度优化 student-likelihood 会使模型趋于保守,过滤掉真正有用但低概率的推理步骤。他建议结合两种思路:先在学生分布支撑附近搜索成功轨迹,再筛选哪些 teacher/token 更新真正值得蒸馏。
所属事件:学者质疑教学法RL:学生似然代理存在盲区(2 条相关)→
「研究」频道最新
- LLM 工作流复现并改进 4000 余篇经济学论文复现包 — soumitrashukla9 · 2026-09-29
- 斯坦福教授提议:给论文配「官方 LLM 评审」,审稿人只需校准 — anshulkundaje · 2026-09-29
- 复用预训练隐状态:三个小 MLP 让 Gemma 4 学会「该不该开口」 — cortexist · 2026-09-29
- 语音引导多模态学习助力实时 MRI 声道分割,MICCAI 2026 登台报告 — maier_ak · 2026-09-29
- Pachocki、Hinton、Bengio 联名论文警告:AI 研发自动化或触发智能爆炸 — birchlse · 2026-09-29
- AI 核查 4452 份经济学复现包,3460 篇论文被发现存疑 — Afinetheorem · 2026-09-29