NAVER 提出 delta 蒸馏法
naver-ai · hf · 2026-07-20
NAVER AI Lab 提出 On-Policy Delta Distillation (OPD²),把蒸馏目标从“模仿教师输出分布”改成监督教师模型与其基础模型之间的 delta signal,即指令微调带来的变化量。
作者认为这种信号更直接地传递推理能力。实验覆盖数学、科学和代码推理基准,显示 OPD² 比传统 on-policy distillation 更稳定、更有效,并且能在较短后训练阶段内获得更强的推理模型表现。代码将开源。
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22