UndoBench 基准:Agent 任务成功率 83.5%,故障恢复仅 46.7%

Dolly Sah · hf · 2026-10-06

HF 论文指出常用 agent 基准只测正常任务完成度,混淆了规划能力与故障恢复能力,于是提出 UndoBench:覆盖 8 个企业领域的 36 个基础工作流与 36 个故障场景,用同种子反事实配对试验及线级效果历史与环境状态 oracle 解耦两种能力。

核心发现(12 个 held-out 工作流、2 个开源模型、2 个框架、3 种恢复范式,5,760 次执行 / 2,880 配对试验)

结论:只评名义完成度会掩盖 agent 阶段相关的关键恢复漏洞。商用 API 模型的扩展实验也复现了这一能力-恢复分离。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →