微软 ReOPD 复用教师前缀,让智能体蒸馏快 4 倍以上
dair_ai · x · 2026-07-27
ReOPD 用教师轨迹回放,把智能体蒸馏训练提速 4 倍以上
微软研究院和阿姆斯特丹大学提出 Replayed-Prefix On-Policy Distillation(ReOPD),面向多轮智能体任务的蒸馏训练。
- 传统 on-policy distillation 每次更新都要重新跑学生与环境交互,还要查询教师,成本很高。
- ReOPD 改为复用预先采集的教师轨迹作为 replayed prefixes:学生在选定步数上行动,教师提供逐步监督,但不再执行新的环境交互。
- 论文指出了多轮蒸馏里的 prefix trap:越把历史推向学生自己的分布,越可能把教师推到其标注不可靠的状态上。
- ReOPD 将问题建模为可靠性感知的前缀分布设计,并用步长递减的采样策略,更偏重前面那些分布偏移更小的前缀。
- 在数学推理(Python)和搜索环境上,它在多种师生模型规模下都能保持或提升准确率,训练时零工具调用,单次 rollout 速度至少快 4 倍。
「编程与Agent」频道最新
- Victor Taelin 给 agent 记忆系统加入树状展开与长程回忆 — AccBalanced · 2026-07-27
- 开发者把 Claude Code 和 Codex 历史合并成千万级消息归档 — doodlestein · 2026-07-27
- 谷歌 15 个免费 AI 工具覆盖营销、编程和音乐 — aigclink · 2026-07-27
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27