只用 1 条提示词做 on-policy 蒸馏,可达 1.7 万条数据的 71.5% 效果

burkov · x · 2026-09-06

清华、国科大、东北大学、伊利诺伊大学与约翰霍普金斯团队研究 on-policy 蒸馏(学生模型基于自身生成、教师在每个 token 给反馈)对训练提示词集合的依赖。论文发现:反复只用 1 条 query 训练,即可恢复约 17000 条 query 带来的大部分提升——单条 query 覆盖全量数据训练所访问状态区域的 71.5%,16 条语义多样的 query 进一步扩大覆盖。原因在于一条 prompt 可生成大量不同的「状态」(prompt + 已生成响应的组合),每个状态都给教师一次纠错机会。这挑战了蒸馏对大规模 prompt 集的固有假设。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →