微软研究院用 ReOPD 离线蒸馏多轮智能体
MicrosoftResearch · hf · 2026-07-24
ReOPD 把多轮蒸馏改成离线前缀复用
Microsoft Research 研究的是多轮环境交互中的 on-policy distillation (OPD),并提出 Replayed-Prefix On-Policy Distillation (ReOPD)。
传统在线 OPD 成本很高,因为每次更新都要重新跑学生模型的环境交互,还要在访问到的历史状态上不断查询教师模型。ReOPD 的思路是直接复用预先收集好的教师轨迹:学生只在部分步骤上行动,教师则对这些步骤给出密集监督,不再需要新的环境执行。
论文指出,多轮 OPD 会遇到一个 prefix trap:越靠后的前缀越接近学生当前分布,但也越可能进入教师目标不可靠的历史状态。为此,ReOPD 用 step-decaying 采样策略,让训练更偏向前面、分布偏移更小的前缀。作者在数学推理 + Python 和搜索环境上实验,发现它在保持或提升准确率的同时,学生训练阶段 不需要 tool calls,整体 rollout 速度至少比在线 OPD 快 4 倍。
「编程与Agent」频道最新
- 开发者重构 Claude Code 工厂:规划、实现、审查三段式 — blaizedsouza · 2026-07-24
- 默认 Codex CLI 跑出 XBOW 92.3%,引发基准失真讨论 — moyix · 2026-07-24
- Sebastian Raschka 将聊 DeepSeek-V4 和开源编码智能体 — hugobowne · 2026-07-24
- Antigravity CLI 1.1.6 让自定义 agent 变成 Markdown — rseroter · 2026-07-24
- FinanceComplexQA 发布 2026 题金融文档推理基准 — Beihang · 2026-07-24
- Compound Engineering 3.20 把编程拆给多模型协作 — danshipper · 2026-07-24