On-policy 蒸馏图解:teacher 按逐 token 给学习信号

helloiamleonie · x · 2026-09-25

Leonie 用例子讲解 on-policy distillation(OPD):把学生模型自己的轨迹喂给 teacher 模型,teacher 基于自身概率对每个 token 打分,衡量它对学生各步的「惊讶程度」——例如对学生从加法开始不惊讶、对中间结果和最终结果非常惊讶。相比稀疏的验证奖励,这为学生模型提供了更密集、更丰富的学习信号。

所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →