On-policy 蒸馏图解:teacher 按逐 token 给学习信号
helloiamleonie · x · 2026-09-25
Leonie 用例子讲解 on-policy distillation(OPD):把学生模型自己的轨迹喂给 teacher 模型,teacher 基于自身概率对每个 token 打分,衡量它对学生各步的「惊讶程度」——例如对学生从加法开始不惊讶、对中间结果和最终结果非常惊讶。相比稀疏的验证奖励,这为学生模型提供了更密集、更丰富的学习信号。
所属事件:Liquid AI 发布 LFM2.5-2.6B 并拆解端侧训练配方(10 条相关)→
「研究」频道最新
- 裸盖菇素改变脑活动时间结构,与主观体验相关 — adeelrazi · 2026-09-25
- 指数均值方差爆炸,Francis Bach 博客提出最小二乘补救方案 — BachFrancis · 2026-09-25
- 威廉玛丽学院 AI Frontier Lab 5 篇论文入选 NeurIPS — jindong_wang92 · 2026-09-25
- 人大团队开源 EvoOntology:为数据 Agent 构建自进化本体层 — JeremyCMorgan · 2026-09-25
- LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走 — helloiamleonie · 2026-09-25
- 把 Qwen3.8 的 n-gram 记忆移植进 0.8B 小模型,困惑度降 5.05% — Nicolodeva · 2026-09-25