RetireOPD:自适应退休自蒸馏,让 Agent RL 成功率提升最多 18.8%
Yan Yu · hf · 2026-09-18
论文提出 RetireOPD(Self-Retiring On-Policy Distillation),用于多轮 Agent 强化学习训练。
- 动机:Agent RL 每条轨迹只有一个标量奖励,自蒸馏(OPD)可从带特权技能的自教师处获得密集 token 级监督;但研究发现特权信息不总让教师可靠,且教师监督收益随训练阶段变化
- 方法:先用环境奖励优化解耦的技能条件教师,再让学生联合 RL 与 OPD 训练;采用 Adaptive Retirement——当师生差距不再缩小、学生达到教师成功率的目标比例时,自动放弃教师,仅用 RL 继续
- 结果:在 Qwen2.5 1.5B–7B 上,ALFWorld 成功率比 RL 基线高 14.1–18.8 个百分点,WebShop 准确率高 11.8–19.0 个百分点,且在所有设置中超过技能条件教师本身
「研究」频道最新
- 机器学习告别炼金术时代:研究将走向可证伪的证据科学 — mike64_t · 2026-09-18
- Together AI 提出分数中心化,修正 RL 训练-推理失配漂移 — PandaAshwinee · 2026-09-18
- Cell 推出 AI 生物学特刊,封面是抗衰老基准 LongevityBench — JosephJacks_ · 2026-09-18
- OpenAI 攻克 Navier-Stokes 后:人类数学家时代正在终结 — yeastsplainer · 2026-09-18
- 团队自研 BB-SLAM:纯视觉里程计 6 个月做出 2 厘米精度地图 — broodsugar · 2026-09-18
- AI4Science 现超预期突破,计算化学工作将大幅提速 — BenBlaiszik · 2026-09-18