UndoBench 基准:Agent 任务成功率 83.5%,故障恢复仅 46.7%
Dolly Sah · hf · 2026-10-06
HF 论文指出常用 agent 基准只测正常任务完成度,混淆了规划能力与故障恢复能力,于是提出 UndoBench:覆盖 8 个企业领域的 36 个基础工作流与 36 个故障场景,用同种子反事实配对试验及线级效果历史与环境状态 oracle 解耦两种能力。
核心发现(12 个 held-out 工作流、2 个开源模型、2 个框架、3 种恢复范式,5,760 次执行 / 2,880 配对试验)
- 名义任务成功率 83.54%,但条件恢复成功率(CRSR)仅 46.72%。
- 朴素重试在 53.33% 的试验中产生重复外部副作用。
- 恢复能力高度依赖故障阶段:变更提交前各方法表现相近;部分变更阶段,朴素重试、逐调用幂等、零权限日志在组合工作流上全部失效;提交后未确认阶段,验证与服务器端幂等显著提升安全性。
结论:只评名义完成度会掩盖 agent 阶段相关的关键恢复漏洞。商用 API 模型的扩展实验也复现了这一能力-恢复分离。
「编程与Agent」频道最新
- T3 Code 上线应用内可视化,Agent 可在会话中构建动态体验 — 0xkarasy · 2026-10-06
- 用 Codex 写连线通信,做出双人对战 Game Boy 涂弹游戏 — pvncher · 2026-10-06
- 零插件用 GPT-6 Astra 搭出可交互 3D 动物图鉴 — CodeByPoonam · 2026-10-06
- 用户实测:Opus 5.5 在何时请求执行许可上明显变聪明 — stefanjblos · 2026-10-06
- Anaconda 发布 agent swarm 编排与自主红队测试新能力 — anacondainc · 2026-10-06
- 对 agent 说「有哪些选项」,一行提示词换来好工程师思路 — _Stocko_ · 2026-10-06