成功工作流在线编译成技能,ALFWorld准确率85.6%且token砍到三分之一

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

COLM) 2026

cs.AI

2026-04-18

FlowEvo免训练地把过关工作流编译成可调用技能,并压制造成负迁移的条目。共享GPT-4o-mini时,五个完整划分全面超过八个基线:ALFWorld 85.6%、token约三分之一,HumanEval 95.1%。

这篇在解决什么

LLM agent 越来越爱在推理时现场拼工作流:拆步骤、调工具、写代码、验中间结果。一轮做完,刚摸索出来的流程通常随轨迹一起丢掉。下一道结构相近的题,模型再推一遍,token 和方差一起涨。

两条现成补救路各管一半。文本记忆能记下当时怎么做成的,但不能当函数调用,也不能拿测试验证。技能和工具库可调用、可检查,却多半离线搭好,跟 agent 自己解题的轨迹是断开的。过关工作流卡在中间:比笔记更可执行,比手工工具更灵活。FlowEvo 要接的就是这一截,底座参数冻结时,怎么把这些工作流变成后续任务能直接用的技能。

方法

FlowEvo 免训练,只在推理时维护技能库。每来一道题,先按词汇重叠、任务模式、接口兼容和历史效用检索,再走三条路由之一:

直接执行要过兼容过滤和校验;失败就回落到条件生成,避免把不匹配的例程硬跑一遍。

过关轨迹才会被编译。编译器抽出入口、推断可调用签名、尽量带上回放测试,并打上来源任务和任务模式标签。ALFWorld 上一条技能分三层:参数化动作模板(把「去微波炉、加热、放到咖啡机」收成带槽位的动作序列)、从轨迹抽出的流程规则、同一任务类型多条轨迹汇总的环境先验。代码和数学任务把过关解法收成可调用片段;解不出就自适应升级,greedy 一遍过,失败才加温、组两个候选、再热再冷地重试,避免每题都跑固定的多阶段流水线。

入库还有准入门:接口能不能按声明调用、回放是否支持声称行为、有没有踩禁用 import 和调用(os、subprocess、eval、exec)。入库后盯下游效用:对比用了该技能和没用时的成功率,引导样本至少 5 条、未引导至少 3 条,差值持续低于 −0.1 就压制。某个种子里 picktwoobjandplace 引导成功率 2/14、未引导 1/3,差值 −0.19,14 轮内被关掉,该任务类型退回动态生成。

结果

共享 GPT-4o-mini、五个完整标准划分,FlowEvo 准确率全场最高,token 在三个基准上最低:

方法ALFWorldHumanEvalMBPPGSM8KMATH-500
ExpeL46.3% / 32,958 tok89.0% / 88373.8% / 78792.1% / 55267.5% / 1,260
AFlow59.2% / 30,13787.2% / 4,57265.5% / 4,02591.4% / 3,07363.5% / 4,292
FlowEvo85.6% / 9,32995.1% / 88079.6% / 2,23097.1% / 54175.9% / 1,532

ALFWorld 比最强基线 AFlow 高 26.4 个百分点,token 约三分之一(9,329 vs 约 3 万)。HumanEval 比经验学习基线 ExpeL 高 6.1 点,token 几乎持平。GSM8K 97.1%、541 token,是五个里最便宜的一档。MBPP 和 MATH-500 用了比 ExpeL 更多 token,换 +5.8 和 +8.4 点准确率。八个基线里最近的工作流优化系统 EvoAgentX、ORCH、MermaidFlow 在代码和数学上同样落后。

ALFWorld 消融(134 题、3 个种子):ReAct 33.6% → 只编译不复用 38.8% → 打开技能反馈 80.6% → 加上生命周期管理 85.6%。主增益在反馈那一档(+41.8)。代表 run 里 101/134 次直接复用,99 次成功,命中率约 75%,大约第 10 轮开始 token 掉下去。库最终饱和在 7 个工作流模板加 18 条样例,因为评测集只有 6 类家务任务。

十个底座、50 组对比,49 组超过 ExpeL,均值 +11.0、中位 +7.0。唯一输掉的是 Qwen3-8B 在 MATH-500 上 −10.0:接口不合格的技能体在准入被拒,库太稀,后面的题捞不到可用技能。GPT-4.1 同族规模梯上,模型越小增益越大,最小号 nano 在 ALFWorld 上相对 ExpeL +53.2。

为什么重要

这是一套可落地的推理时自进化:不改权重,靠把过关结构沉淀成可调用对象。家务这类「任务类型反复出现、参数在变」的环境,直接复用几乎把探索成本砍掉。代码和数学题大多彼此不重复,直接复用帮不上忙,增益主要来自技能条件生成,以及验证失败才升级的策略。对要做 agent 的人,更接近「跑完一轮别把流程扔掉」,小模型上增益更大,这层能力库更像在补结构。

主结果里最抢眼的 ALFWorld 数字,相当一部分是同类任务直接重放模板。换成题题独特的设定,优势会收窄到几个点。

局限与存疑

实验都依赖环境反馈或隐藏测试。去掉「必须过验证才编译」只掉 1.5 点,20% 标签对翻只掉 1.7 点,McNemar p>0.1,弱监督还撑得住。没有对错信号的闲聊、长文写作明确不在范围内。延迟、部分、对抗性反馈没测。

ALFWorld 是在 134 道评测题上边跑边攒技能,不是先在训练集长库再冻结评测。MBPP 的冻结库协议里,可精确迁移的 71 题上,可执行复用 85.9%/204 token,动态生成 81.7%/224,文本工作流记忆 87.3%/378 token,文本还略高一点。全量 MBPP 上四种路由器两两差距不到 0.6 点,McNemar p>0.5,路由细节撑不起主结论。五个基准各自从空库起步,没有跨域迁移证据。Qwen3-8B 在 MATH-500 说明循环有能力地板:底座写不出合格技能体,库就空转。代码和数学的 token 优势也混进了自适应升级,不能全部记在技能复用账上。

术语

原文与代码

相关论文

全部论文解读