南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍
SouthernUniversityofScienceandTechnology · hf · 2026-09-30
南方科技大学提出 ActFirst-OPD,一个「先行动、后思考」的训练框架,解决多轮智能体在线策略蒸馏(OPD)中环境交互被长推理阻塞的问题。核心思路:
- 标准 think-then-act rollout 要求每步动作前生成长推理,拖慢环境转换与经验收集;ActFirst 让学生在「参考条件逆动力学」下先直接执行动作,当轨迹偏离参考轨迹时切换回自主预测下一动作。
- 随后基于收集的交互上下文异步生成完整 think-then-act 响应,做 token 级教师监督。
在 0.6B/1.7B/4B 的 Qwen3 学生模型上:相比 Vanilla OPD,ALFWorld 平均加速 2.3 倍,WebShop 1.8 倍,ScienceWorld 4.9 倍;任务成功率在 9 组基准-模型设置中的 8 组持平或超越所有 OPD 基线。证明多轮 agent 蒸馏中推理不必阻塞行动。
「编程与Agent」频道最新
- xiaohu 晒 AI Agent 分配的电脑:装好浏览器还能打电话 — xiaohu · 2026-09-30
- Bittensor SN107 推出第二激励机制:AI 智能体跑基因研究任务 — markjeffrey · 2026-09-30
- 保留失败的 agent 任务:每次新模型发布重跑,抓住质变时刻 — victor_explore · 2026-09-30
- Agent 演示都很惊艳,一遇到例外就露馅 — yi111 · 2026-09-30
- 程序员自述:AI 辅助开发中每轮重构都会让旧问题迁移到新代码 — ssh4net · 2026-09-30
- 用户实测 Opus 5.5:速度快但常无视技术规格自行改写代码 — ssh4net · 2026-09-30