预构建技能最多保住41%知识,ExpVoyager按需导航原始轨迹

ExpVoyager: Direct Experience Navigation for Dynamic Agent Skill Synthesis

Kwangwook Seo, Dongha Lee

cs.CL

2026-09-26

延世大学提出ExpVoyager,让技能策展人在原始轨迹上按需导航并即时合成技能文件。Qwen3.5-9B执行时ALFWorld成功率达63.7%,高于SkillTTA的51.1%和ReAct基线的41.4%。

这篇在解决什么

Agent skill 已经从人手写说明书,走到从自己跑过的轨迹里蒸馏可复用程序知识。AWM、ReasoningBank、Trace2Skill 都是任务未知时先抽象成固定 skill 再检索。

抽象发生得太早。延世大学在 ALFWorld 上构造了 80 条经执行验证的 oracle skill,并在 300 条源轨迹上标注哪些知识能支撑这些 skill。预构建产物最多只保住源轨迹里 40.9% 的目标相关知识(AWM),Trace2Skill 31.5%,ReasoningBank 12.7%。检索也补不回来,加大 top-k 会抬 recall、掉 precision。相似轨迹里夹着无关细节,关键局部线索又可能出现在表面不像的轨迹里。

问题是对着当前任务,在原始轨迹上主动找,并按需要的分辨率去看。

方法

ExpVoyager 把 skill 合成做成一次经验导航。执行器 θ 冻结,skill curator ϕ 在经验库 E 上搜索,产出针对当前任务 x 的 skill.md,再作为额外上下文交给执行器。

策展人面对一套 Navigable Interface(可导航接口),同一条轨迹拆成两种视图:

每轮选一个导航动作。searchexp 指定视图层级、字段、正则和条数上限,命中后返回完整 step 或 trajectory 记录,并带源轨迹引用。需要更大上下文时,inspecttraj 按引用把整条轨迹按时间展开。默认预算 20 轮,也可以提前 FINISH。

配套的是 Navigation State Z=(K,Q)。K 是已经为当前任务整理出的知识条目,每条拆成三截:源轨迹里观察到什么、哪条程序关系可能迁移、当前环境还要现场验证什么。Q 是还没查清的开放问题,从任务描述初始化,随观察改写或新增。状态的作用像带着问题清单翻实验记录:每看到一条新记录,就更新已确认的程序和还要查的缺口。逛完后,策展人把 Z 写成 skill.md,能迁移的写成步骤,未决条件写成执行时检查,失败教训写成恢复指引。

相似检索把「像不像」当成「用不用得上」。这套接口让模型自己决定看哪一层、追哪条轨迹。状态则拦住把源环境里的具体位置当成当前房间的事实。

结果

默认设置里 Qwen3.5-9B 同时当策展人和执行器,离线经验库 ALFWorld、WebShop 各 1000 条,ScienceWorld 500 条,三次随机平均。

方法ALFWorld SRWebShop SRScienceWorld SR
ReAct41.419.627.0
AWM45.624.232.6
ReasoningBank43.520.329.6
Trace2Skill45.422.631.9
SkillTTA51.119.229.6
ExpVoyager63.728.737.4

ALFWorld 平均步数从 ReAct 的 34.1 降到 25.9。WebShop 分数 61.2,对照 SkillTTA 的 34.3 和 ReAct 的 50.3。ScienceWorld 分数 47.0,对照最好的预构建基线 AWM 为 42.7。

执行器换成 Gemma4-31B、策展人仍是 9B 时,ALFWorld 成功率从 53.9 到 69.6。策展人换成同款 31B 是 71.3,换成 GPT-5.4-mini 到 75.9。9B 策展人已经能抬 31B 执行器,说明从经验里挑什么,和模型本身解题能力是分开的。

在线设定没有预采集经验,只复用当前任务流里更早的轨迹。经验少时增益有限,甚至会掉点。任务流结束时,ALFWorld 相对 ReAct 的累计成功增益约 15%,对照停在 3% 到 7%;ScienceWorld 约 18%,对照约 6% 到 11%。离线把源轨迹从嵌套子集扩到 1000 条时,基线成绩往下走,ExpVoyager 继续涨。

ALFWorld 消融:去掉 Navigable Interface,成功率 63.7 掉到 55.3,发现的知识里 52% 是无关项;去掉 Navigation State,成功率 58.9,重复知识占到 47%。完整系统新知识约占 62%。导航加到 20 轮还在涨,再往上会掉。对齐 token 的多轮 agentic search 对照里,主动导航仍然更高。预构建 skill 当起点再导航补全,多数设置分数更高、token 更低,论文写明只有一个例外。

为什么重要

这是 agent harness 里 skill 层的一条岔路。skill.md 可以不在部署前写死,运行时对着原始轨迹现编。已有 AWM 或 ReasoningBank 的系统可把旧 skill 当起点再补缺口。

代价清楚。默认 20 轮导航,端到端 token 比检索三条 workflow 贵一个数量级,大约每任务 27 万到 45 万。适合轨迹结构清楚、失败可复盘的交互环境,杂乱 tool-call 日志没有实验。

它证明的是访问方式。经验变多时基线变差、导航变好,预蒸馏在规模上去之后会放大噪声。

局限与存疑

正文没有 Limitations 节,边界来自实验设置和报出的失败模式。

三套 benchmark 全是文本交互:家务、购物、科学实验模拟,单局上限 50、15、30 步。没有软件工程、真实浏览器或长工具链。oracle 知识标注和 claim 匹配用了更强模型加人工复核,但只覆盖 ALFWorld 的 80 条 oracle skill 和 300 条源轨迹,「丢掉过半知识」不能直接外推到 WebShop。

经验很少时导航会伤成绩,超过 20 轮也会掉,这套环对噪声和过度搜索敏感。执行器冻结,skill 只进上下文,没有用环境反馈去改策展策略。WebShop 上 SkillTTA 成功率 19.2、分数 34.3,都低于 ReAct,test-time 合成本身就不稳,领先幅度有一部分来自对照偏弱。附录有 failure cases,正文未量化失败类型,也没有在相同正确率下对照「多采样 ReAct」。

术语

原文与代码

相关论文

全部论文解读