新课程梳理 on-policy 蒸馏:从 Hinton 软目标到前沿后训练
burkov · x · 2026-09-04
Burkov 发布新课程「必读论文:on-policy distillation」,梳理知识蒸馏的技术演进:
- 从 Hinton 最初的 soft-target 蒸馏目标讲起
- 追踪到今天前沿后训练(post-training)中使用的多教师 on-policy 流水线
- 核心转变:从让学生模型在固定教师输出语料上训练,改为从学生自身采样——这一改变解决了 exposure bias,重塑了语言模型压缩与对齐方式
- 并展示该技术如何应用于当今最大模型的技术报告
可在 ChapterPal 平台配 AI 导师阅读。
「研究」频道最新
- 开源项目 Marin 启动 535B/A23B MoE 训练,一年内从 1 人扩到 10 人 — wandb · 2026-09-04
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Foresight 推出新 RFP:最高 10 万美元资助开源 AI 科学与安全项目 — niloofar_mire · 2026-09-04
- 研究者用 Lean4 机器验证解决 Chrisnata et al 开放问题 — _xjdr · 2026-09-04
- NeurIPS 悉尼几秒内门票售罄,距录用放榜还有三周 — alrojo · 2026-09-04