微软研究院用 ReOPD 离线蒸馏多轮智能体

MicrosoftResearch · hf · 2026-07-24

ReOPD 把多轮蒸馏改成离线前缀复用

Microsoft Research 研究的是多轮环境交互中的 on-policy distillation (OPD),并提出 Replayed-Prefix On-Policy Distillation (ReOPD)。

传统在线 OPD 成本很高,因为每次更新都要重新跑学生模型的环境交互,还要在访问到的历史状态上不断查询教师模型。ReOPD 的思路是直接复用预先收集好的教师轨迹:学生只在部分步骤上行动,教师则对这些步骤给出密集监督,不再需要新的环境执行。

论文指出,多轮 OPD 会遇到一个 prefix trap:越靠后的前缀越接近学生当前分布,但也越可能进入教师目标不可靠的历史状态。为此,ReOPD 用 step-decaying 采样策略,让训练更偏向前面、分布偏移更小的前缀。作者在数学推理 + Python 和搜索环境上实验,发现它在保持或提升准确率的同时,学生训练阶段 不需要 tool calls,整体 rollout 速度至少比在线 OPD 快 4 倍。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →