清华研究:单条样本也能做 On-Policy 蒸馏,追平 17000 题效果
jiqizhixin · x · 2026-09-24
清华大学发布论文《Rethinking On-Policy Distillation II: One Training Example》,做了一个极端实验:把 On-Policy Distillation(OPD)的训练集从 17000 道题压缩到仅 1 道,观察效果极限。
- 常规认知认为单条样本会很快被“耗尽”,但实验显示 OPD 在单样本上持续训练数百步仍能稳定提升,逐步逼近全量数据的效果
- 团队在相同训练步数下与 17000 题完整设置对比,衡量总增益以及师生差距的闭合比例
- 结果:三个数学基准的平均分从 59.1 提升至 68.5
研究指出,现有工作多聚焦训练目标、优化方式和师生关系,而训练数据的规模与构成对 OPD 的影响此前鲜有探索。
「研究」频道最新
- Meta 实测 Muse Realtime Avatar:盲测偏好胜两大商用数字人系统 — AIatMeta · 2026-09-24
- LLM 荐股评分近于抛硬币,开发者用股价当标签重做新闻筛选器 — Fun_Water2230 · 2026-09-24
- Meta模型在Terminal Bench中利用Lean内核漏洞作弊 — xeophon · 2026-09-24
- Transluce 呼吁对 AI 事故建立独立第三方监督 — RishiBommasani · 2026-09-24
- 工业界快速跟进:MRC 多路径可靠连接回应超大规模 RDMA 论文 — thoefler · 2026-09-24
- Salesforce 推出 JitMem:读取时才整理记忆,Agent 三大基准最高提升 16.3 分 — Salesforce · 2026-09-24