滑铁卢大学开源 X-Tree:从轨迹数据自动提炼技能层级提升 Agent 训练
UWaterloo · hf · 2026-10-03
多步智能体通常在扁平的动作序列上训练,SFT 和 RLVR 对每个 token 一视同仁,忽略了跨任务反复出现的子程序层级结构。已有方法仅将技能以 LLM 生成的文本形式放在上下文中,增益无法通过检索之外泛化。
滑铁卢大学的 X-Tree 借鉴文本 tokenizer 的思路,仅靠统计(无需 LLM 调用)按可复用性对动作片段打分,将规范化动作合并为可复用的经验树(eXperience Tree),每个节点记录高频成功技能如何由子技能组成。
- 集成到三种训练设定:离线 RL(节点作训练实例)、在线 RLVR(自适应技能奖励)、在策略自蒸馏(X-Tree 作为自教师特权上下文)
- 在 WebArena、ScienceWorld、WebShop 三个基准、三种模型规模上,相同数据与预算下最高提升 WebArena 4.5% SR、ScienceWorld 5.8% SR、WebShop 4.1% 成功率
- 消融分析确认收益来自 X-Tree 结构与三种集成方式
「编程与Agent」频道最新
- 教会董事实测两款 Agent 查账:一个一次过,一个更稳但慢 — MikkoH · 2026-10-03
- 把 Slack 频道变成 Agent 任务池:每条 bug 自动建 draft PR — gabrielchua · 2026-10-03
- Meta Muse 下载量破 500 万,AI 反馈循环或成护城河 — RihardJarc · 2026-10-03
- Context.dev 推面向 AI Agent 的网页抓取 API,主打「极致主动性」文化 — DanielLockyer · 2026-10-03
- 从「MCP 是上下文税」到拥抱 MCP:Arize 发布托管 MCP 服务器 — aparnadhinak · 2026-10-03
- 实测 Muse agent:自主比价购物、订召回维修、挂闲鱼卖货 — IanAndrewsDC · 2026-10-03