微软 ReOPD 复用教师前缀,让智能体蒸馏快 4 倍以上
dair_ai · x · 2026-07-27
ReOPD 用教师轨迹回放,把智能体蒸馏训练提速 4 倍以上
微软研究院和阿姆斯特丹大学提出 Replayed-Prefix On-Policy Distillation(ReOPD),面向多轮智能体任务的蒸馏训练。
- 传统 on-policy distillation 每次更新都要重新跑学生与环境交互,还要查询教师,成本很高。
- ReOPD 改为复用预先采集的教师轨迹作为 replayed prefixes:学生在选定步数上行动,教师提供逐步监督,但不再执行新的环境交互。
- 论文指出了多轮蒸馏里的 prefix trap:越把历史推向学生自己的分布,越可能把教师推到其标注不可靠的状态上。
- ReOPD 将问题建模为可靠性感知的前缀分布设计,并用步长递减的采样策略,更偏重前面那些分布偏移更小的前缀。
- 在数学推理(Python)和搜索环境上,它在多种师生模型规模下都能保持或提升准确率,训练时零工具调用,单次 rollout 速度至少快 4 倍。
「编程与Agent」频道最新
- ChatGPT 联合发明者发文:给 Claude Code 加 100ms 上下文过滤器,告别压缩 — PrajwalTomar_ · 2026-09-23
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- Massive 联手 Coinbase,AI Agent 可付费获取实时市场数据 — kleffew94 · 2026-09-23