X-Tree 论文:零 LLM 调用挖掘轨迹技能树,训练数据、奖励、上下文三用
hllo_wrld · x · 2026-10-06
滑铁卢大学、杜克与新加坡国立大学的新工作 X-Tree:现有 agent 训练(SFT、RLVR)都在平坦动作序列上逐 token 均匀加权,浪费了任务间反复出现的可复用子过程。作者借鉴文本 tokenizer 的思路,不调用任何 LLM,仅通过统计动作片段的可复用性并合并规范化动作,从已有轨迹中挖掘出一棵「经验树」。
每个 X-Tree 节点描述一个高频且导向成功的技能如何由子技能组合而成,并以三种方式接入训练:作为数据(offline RL 的训练实例)、作为奖励(online RLVR 的自适应技能加分)、作为上下文(on-policy 自蒸馏中自教师的特权上下文)。
在 WebArena、ScienceWorld、WebShop 三个基准、三个模型规模上均带来提升,实现更高效的 agent 泛化。
「编程与Agent」频道最新
- 独立开发者给 meme 站做了 MCP 服务器,让 AI 智能体直接发帖玩梗 — AlternativeEast7175 · 2026-10-06
- AI Agent 距大众化尚远:Muse 下载量远不及当年 Threads — FinanceYF5 · 2026-10-06
- 用 Opus 5.5 逆向蜘蛛侠2物理,移植进 GTA V — Promptmethus · 2026-10-06
- 模型进化快过折腾党,裸用 Codex 反而最前沿 — pvncher · 2026-10-06
- 开发者吐槽 Codex 频繁抢占浏览器,放着 MCP 不用 — alexgoughcooper · 2026-10-06
- AI 生成 3D 冲浪游戏 Tideline 上线:可免费游玩、支持手柄 — majidmanzarpour · 2026-10-06