只用 1 条提示词做 on-policy 蒸馏,可达 1.7 万条数据的 71.5% 效果
burkov · x · 2026-09-06
清华、国科大、东北大学、伊利诺伊大学与约翰霍普金斯团队研究 on-policy 蒸馏(学生模型基于自身生成、教师在每个 token 给反馈)对训练提示词集合的依赖。论文发现:反复只用 1 条 query 训练,即可恢复约 17000 条 query 带来的大部分提升——单条 query 覆盖全量数据训练所访问状态区域的 71.5%,16 条语义多样的 query 进一步扩大覆盖。原因在于一条 prompt 可生成大量不同的「状态」(prompt + 已生成响应的组合),每个状态都给教师一次纠错机会。这挑战了蒸馏对大规模 prompt 集的固有假设。
「研究」频道最新
- ICML 论文:对最后 5 层做 LoRA 超拟合可消除 AI 味 — grimjim · 2026-09-06
- 1000 美元训出 HRM-Text,Sapient 递归架构抢在 Astra 之前押注 — rohanpaul_ai · 2026-09-06
- 熵轨迹形状可预测 Qwen3-4B 出错,并能迁移到未见任务 — Happy_Brilliant7827 · 2026-09-06
- Domingos 调侃:等着看 AI 批量生成弦理论论文的速度吧 — pmddomingos · 2026-09-06
- Agent Foundations 论文 Lean 形式化竟发现 Logical Induction 原文一处错误 — jessi_cata · 2026-09-06
- 17 页免费 PDF 讲透隐马尔可夫模型 HMM 原理 — Roger_M_Taylor · 2026-09-06