解析长任务训练崩溃:自蒸馏为何优于GRPO与RLHF

AI Engineer · youtube · 2026-08-12

在这场技术演讲中,Ronak Malde 深入探讨了持续学习在规模化长任务(如包含上百次工具调用的轨迹)中面临的挑战。他指出,传统的策略自蒸馏会导致模型陷入过度对冲,倾向于使用“wait”、“but”等词汇,最终使输出变成毫无意义的“maybe”。

Malde 提出了一种自蒸馏算法:在前沿模型缺乏更优秀教师的情况下,让模型自我教学。具体做法是在教师提示中注入特权信息(提示),并让未看到提示的学生模型匹配其对数概率。这种方法满足了在线任务分布、策略采样等四大核心属性,且能对全词表进行优化,表现优于 GRPO 和 RLHF。演讲还剖析了提示泄漏(类似奖励黑客)等失败模式及其解决思路。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →