论文:单条查询即复现 72% 全数据蒸馏收益,OPD 是数据过剩而非缺数据
heghbalz · x · 2026-09-06
论文《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》考察 on-policy 蒸馏(OPD)中训练数据的真实作用:
- 只训一条 query 也能持续提升:one-shot OPD 训练数百步后,能恢复全数据 OPD 在各任务域和模型家族上的大部分增益。
- 状态覆盖是关键:单条 query 的 rollout 已覆盖全数据 OPD 所访问状态的 71.5%,且大部分在前 100 步内完成;16 条语义不同 query 达到 98.9% 覆盖并追平全数据训练。
- 瓶颈在算法不在数据:学生吸收教师 token 级密集监督的速度很慢,无论 1 条还是全部数据,对齐速度相似。结论:OPD「数据过剩、算法饥饿」。
- 该状态覆盖结论也适用于多教师 OPD,内容空洞模板和域外 query 也接近真实 query 基线。
作者含 Zhiyuan Liu、Ning Ding 等,对蒸馏数据成本有直接指导意义。
所属事件:研究称单条样本即可复现72%蒸馏收益,OPD缺的是算法(2 条相关)→
「研究」频道最新
- AI 帮改论文时发现文献命题反例,作者已邮件联系原作者 — jessi_cata · 2026-09-06
- NeurIPS 2026 注册开放:悉尼主会场,亚特兰大与巴黎设卫星会场 — NeurIPSConf · 2026-09-06
- interp 与 mech interp 之争:解读模型不必非找机制 — voooooogel · 2026-09-06
- 为 RL 训练做确定性奖励:作者用 Astra 构建标题可读性评分函数 — ivan_bezdomny · 2026-09-06
- 数月数学证明工作,Astra 26分钟给出38页常数规模版本 — kfountou · 2026-09-06
- Claude Fable 5.1 得分 81.9%,SimpleBench 原文显示仍未破人类基线 — koltregaskes · 2026-09-06