On-policy 蒸馏再思考:单个样本即可持续提升,缺的是算法而非数据
Thinking-Space · hf · 2026-09-04
Thinking-Space 团队的「Rethinking On-Policy Distillation II」研究给出反直觉发现。
- 核心结论:仅用一个训练样本(单条 query),on-policy 蒸馏就能在数百步训练中持续改进学生模型
- 机制:学生快速覆盖教师模型的状态空间,因此数据并非瓶颈
- 但学生与教师的对齐速度仍然缓慢——作者据此判断该方法是「算法饥饿」而非「数据饥饿」,改进空间在算法设计而非堆数据
- 对蒸馏训练的资源配置(数据成本 vs 算法创新)有直接指导意义
「研究」频道最新
- FlashRender:相机控制视频少步生成渲染,兼顾质量与速度 — everex · 2026-09-04
- Puffin-World:用原生 3D 世界状态扩展统一多模态世界模型 — Kang Liao · 2026-09-04
- LatentStream:渐进式潜在记忆演化让流式视频理解持续推理 — Hongyu Qu · 2026-09-04
- Temporal Context Routing:让音视频生成的镜头与台词对齐剧本时间轴 — Yichen Liu · 2026-09-04
- Reddit 热议:Agent 轨迹越长越不可靠,但没人量化过拐点 — rio_ARC · 2026-09-04
- 用贝叶斯 Bandit 从数学上定义「好奇心」 — CatAstro_Piyush · 2026-09-04