研究称单条样本即可复现72%蒸馏收益,OPD缺的是算法

Thinking-Space 团队的论文《Rethinking On-Policy Distillation II: One Training Example》得出反直觉结论:在 on-policy 蒸馏中,仅用一条训练样本就能持续提升效果,并复现约 72% 的全量数据蒸馏收益。这表明当前 LLM 训练的瓶颈在于算法而非数据,on-policy 蒸馏面临的是数据过剩而非数据不足的问题。

2026-09-04 ~ 2026-09-06 · 2 条相关