ScrambleToolBench 发现 Agent 遇到变更仍靠穷举

declare-lab · hf · 2026-08-04

ScrambleToolBench 发现:工具一变,Agent 往往只会更用力地穷举

这篇研究提出 ScrambleToolBench,一个交互式终端 benchmark,用来测试 agent 能不能只靠交互、而不是文档,自己推断陌生工具的行为。

这个 benchmark 怎么设计

评测结论

核心意义

这个 benchmark 把“能第一次摸索出来”与“环境一变还能稳住”之间的差距,清楚地暴露出来了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →