ScrambleToolBench 发现 Agent 遇到变更仍靠穷举
declare-lab · hf · 2026-08-04
ScrambleToolBench 发现:工具一变,Agent 往往只会更用力地穷举
这篇研究提出 ScrambleToolBench,一个交互式终端 benchmark,用来测试 agent 能不能只靠交互、而不是文档,自己推断陌生工具的行为。
这个 benchmark 怎么设计
- 去掉工具 schema 里的语义提示。
- 采用连续任务课程。
- 加入 映射漂移、随机动作失败 和 时序执行窗口 等动态扰动。
评测结论
- 先进语言模型通常能完成初始发现,但不能稳定适应变化。
- 面对工具映射变化时,agent 不太会用 cycle tracing 这类演绎式恢复策略。
- 更常见的是 belief inertia(信念惯性)或者直接回到穷举搜索。
- 增强 test-time reasoning 往往只是让穷举更昂贵,并没有带来真正的推理恢复。
- 持久记忆能减少错误累积,但仍不足以让 agent 高效识别结构变化。
核心意义
这个 benchmark 把“能第一次摸索出来”与“环境一变还能稳住”之间的差距,清楚地暴露出来了。
「编程与Agent」频道最新
- 多智能体系统可能把笔记本内存和 CPU 吃满 — zephyr_z9 · 2026-08-04
- Grok 现已支持直接观看视频链接并回答问题 — Kyrannio · 2026-08-04
- Doota Mail 自托管改成 fork、加密钥再跑 CI — samgoodwin89 · 2026-08-04
- Codex 通过 MCP 把图片和视频生成外包给 GlobalGPT — SarahAnnabels · 2026-08-04
- Codex 把多模态生成交给 GlobalGPT 再回填工作区 — SarahAnnabels · 2026-08-04
- GlobalGPT 推出终端 CLI,可直接做聊天和多模态生成 — SarahAnnabels · 2026-08-04