微软研究院用 ReOPD 离线蒸馏多轮智能体
MicrosoftResearch · hf · 2026-07-24
ReOPD 把多轮蒸馏改成离线前缀复用
Microsoft Research 研究的是多轮环境交互中的 on-policy distillation (OPD),并提出 Replayed-Prefix On-Policy Distillation (ReOPD)。
传统在线 OPD 成本很高,因为每次更新都要重新跑学生模型的环境交互,还要在访问到的历史状态上不断查询教师模型。ReOPD 的思路是直接复用预先收集好的教师轨迹:学生只在部分步骤上行动,教师则对这些步骤给出密集监督,不再需要新的环境执行。
论文指出,多轮 OPD 会遇到一个 prefix trap:越靠后的前缀越接近学生当前分布,但也越可能进入教师目标不可靠的历史状态。为此,ReOPD 用 step-decaying 采样策略,让训练更偏向前面、分布偏移更小的前缀。作者在数学推理 + Python 和搜索环境上实验,发现它在保持或提升准确率的同时,学生训练阶段 不需要 tool calls,整体 rollout 速度至少比在线 OPD 快 4 倍。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11