南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍

SouthernUniversityofScienceandTechnology · hf · 2026-09-30

南方科技大学提出 ActFirst-OPD,一个「先行动、后思考」的训练框架,解决多轮智能体在线策略蒸馏(OPD)中环境交互被长推理阻塞的问题。核心思路:

在 0.6B/1.7B/4B 的 Qwen3 学生模型上:相比 Vanilla OPD,ALFWorld 平均加速 2.3 倍,WebShop 1.8 倍,ScienceWorld 4.9 倍;任务成功率在 9 组基准-模型设置中的 8 组持平或超越所有 OPD 基线。证明多轮 agent 蒸馏中推理不必阻塞行动。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →