PlanBench-XL 基准:327 任务与 1665 工具的长程评测思考

Shahules786 · x · 2026-08-20

作者分享了阅读 PlanBench-XL 论文后的思考,认为基准测试构建本身已成为研究问题。PlanBench-XL 包含 327 个零售任务和 1665 个工具,其核心创新在于通过输入/输出数据类型在工具图中采样路径来合成可解任务(如 orderid -> paymentdetails)。作者指出,这种方法虽然能保证任务可解性,但数据真实性问题仍是开放挑战:任务条件化环境合成可能导致分布狭窄,且 LLM 在填充看似真实世界的关联数据库值方面仍较弱。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →