单条查询训数百步仍持续提升,One-Shot OPD 复现全数据蒸馏大部分收益
ParshinShojaee · x · 2026-09-04
团队在发布 Rethinking OPD 后继续深入研究 On-Policy Distillation 的机制,提出 One-Shot OPD:只用一条查询就能让学生模型在数百步训练中持续改进,并恢复全数据 OPD 的大部分收益。
他们的解释是 OPD 处于「数据过饱、算法饥饿」状态:
- 数据层面:一条查询已经覆盖了全数据训练中大部分的状态空间;
- 算法层面:学生模型每一步吸收剩余误差的能力递减,边际收益逐步缩小。
「研究」频道最新
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- 从 agent trace 到训练数据集:采样、标注的完整工作流拆解 — spilldahill · 2026-09-04
- 研究者可视化 Qwen 2.5 嵌入空间,称主流模型对话能力正在变平 — arianaram · 2026-09-04
- DeepMind 科学家谈 MatFormer:让智能体按任务难度调算力 — jainprateek_ · 2026-09-04
- 李飞飞团队谈 Atlas 世界模型:新视角预测是核心原语 — a16z Podcast · 2026-09-04
- 具身数据集 ACE-Data-0 上线一周冲上 HF 热榜,下载近 3 万 — liuziwei7 · 2026-09-04