NAVER 提出 delta 蒸馏法

naver-ai · hf · 2026-07-20

NAVER AI Lab 提出 On-Policy Delta Distillation (OPD²),把蒸馏目标从“模仿教师输出分布”改成监督教师模型与其基础模型之间的 delta signal,即指令微调带来的变化量。

作者认为这种信号更直接地传递推理能力。实验覆盖数学、科学和代码推理基准,显示 OPD² 比传统 on-policy distillation 更稳定、更有效,并且能在较短后训练阶段内获得更强的推理模型表现。代码将开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →