PlanBench-XL让Agent学会找工具
Shahules786 · x · 2026-07-14
作者介绍了 PlanBench-XL 的做法:它通过 retrieval interface 处理工具信息,而不是把所有工具定义直接塞进上下文。
设计点
- 工具定义存放在文件中
- agent 需要在任务过程中反复检索所需工具
- 这样更接近企业环境:工具很多,但上下文里不可能一次性看到全部
作者还提到,他们在自己的环境里也在尝试把同一组任务做成“完全可见 / 部分可见”两种模式,用来同时 benchmark 和训练 agent 去主动探索工具库。
所属事件:PlanBench-XL 探索大规模工具环境下的 Agent 训练(3 条相关)→
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11