X-Tree 论文:零 LLM 调用挖掘轨迹技能树,训练数据、奖励、上下文三用

hllo_wrld · x · 2026-10-06

滑铁卢大学、杜克与新加坡国立大学的新工作 X-Tree:现有 agent 训练(SFT、RLVR)都在平坦动作序列上逐 token 均匀加权,浪费了任务间反复出现的可复用子过程。作者借鉴文本 tokenizer 的思路,不调用任何 LLM,仅通过统计动作片段的可复用性并合并规范化动作,从已有轨迹中挖掘出一棵「经验树」。

每个 X-Tree 节点描述一个高频且导向成功的技能如何由子技能组合而成,并以三种方式接入训练:作为数据(offline RL 的训练实例)、作为奖励(online RLVR 的自适应技能加分)、作为上下文(on-policy 自蒸馏中自教师的特权上下文)。

在 WebArena、ScienceWorld、WebShop 三个基准、三个模型规模上均带来提升,实现更高效的 agent 泛化。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →