OPD² 只蒸馏推理微调新增增量,不学教师旧风格
coallaoh · x · 2026-07-23
- 这条帖介绍了一篇关于 On-Policy Delta Distillation(OPD²) 的论文。
- 传统的 on-policy distillation 会让学生模型尽量模仿教师模型的整体输出分布;而 OPD² 只蒸馏 teacher 与 base model 之间的差分信号,也就是 reasoning tuning 真正新增的部分。
- 论文想解决的是:不要把教师模型在推理微调前就有的风格和偏好也一并拷贝过去,而是尽量只保留推理能力提升带来的增量。
- 配图还对比了 OPD 与 OPD² 的训练流程,强调 OPD² 关注的是“学习轨迹”中的关键增量。
「研究」频道最新
- Mila 将讨论非洲语言 AI 基准到底测什么 — hugo_larochelle · 2026-07-23
- 一张 Agent 技术栈图:生产级 AI 90% 靠系统架构 — theomitsa · 2026-07-23
- MIT 免费 SLAM 教程把机器人导航讲成实战入门 — lukas_m_ziegler · 2026-07-23
- Sol 5.6 被称只靠一个提示词写出整篇论文 — conitzer · 2026-07-23
- NeurIPS position paper 审稿结果已发布 — hiddenmarkov · 2026-07-23
- LLaDA2.2-flash 把 128K 上下文和编辑式扩散带进 agent 模型 — pmttyji · 2026-07-23