AutomationBench-AA发布:评估AI自动化SaaS工作流能力
Artificial Analysis联合Zapier推出了全新的自动化能力基准AutomationBench-AA,并配套发布了arXiv论文、GitHub仓库与Zapier排行榜。该基准旨在测试AI agent能否在遵守业务规则的前提下,自动化真实的SaaS工作流,为业界评估大模型的工具调用与自动化编排能力提供了新标准。
评测机制与任务难度
AutomationBench-AA包含657个工作流自动化任务,覆盖金融、HR、营销、运营、销售和支持六大业务领域。模型需要通过REST API在40个模拟的SaaS应用环境中进行跨应用工作编排,最终根据系统状态的完成度进行程序化评分。任务难度因领域而异,其中财务工作流最难自动化,所有模型合计仅完成约三分之一的财务目标,大约是客服和运营领域(约60%完成率)的一半。
模型表现与成本差异
在自动化执行风格上,不同模型差异显著。例如,GPT-5.5(xhigh)偏向密集操作,平均每个任务调用49次工具、跨25轮完成;而Claude Opus 4.8(max)则更为审慎,工具调用集中在14轮内(平均35次)。此外,各模型的单任务成本相差超过一个数量级:DeepSeek V4、Gemini 3.1 Flash-Lite和Qwen3.7 Plus的单任务成本低于5美分,而Claude Opus 4.8(max)接近1.5美元。不过,成本高并不绝对等同于表现好,领先者并非总是最贵的。
护栏违规与效率排名
除了完成目标,agent还必须避免触发代表业务规则的护栏。评测显示,所有参评模型在发布时都会触发不同程度的护栏违规。若按“每违规一次所完成的有效目标数”来调整效率排名:Gemini 3.5 Flash表现最佳(每违规完成15.0个目标),Claude Opus 4.8(max)紧随其后(13.5个),而Claude在整体操作中的护栏违规相对更少(每任务0.次,此处依原帖数据表述)。
2026-07-07 ~ 2026-07-07 · 7 条相关
一手来源
- AutomationBench-AA:AI agent自动化SaaS工作流榜单 — ArtificialAnlys ·
- Zapier AutomationBench-AA:657个工作流自动化任务 — ArtificialAnlys ·
- AutomationBench-AA 自动化基准发布 — ArtificialAnlys ·
- 【源头】AutomationBench-AA:AI agent自动化SaaS工作流榜单 — ArtificialAnlys · 2026-07-07
- 【源头】Zapier AutomationBench-AA:657个工作流自动化任务 — ArtificialAnlys · 2026-07-07
- AutomationBench:按护栏违规调整后的效率排名 — ArtificialAnlys · 2026-07-07
- AutomationBench:财务工作流最难自动化 — ArtificialAnlys · 2026-07-07
- AutomationBench模型单任务成本跨一个数量级 — ArtificialAnlys · 2026-07-07
- 【源头】AutomationBench-AA 自动化基准发布 — ArtificialAnlys · 2026-07-07
- AutomationBench:GPT-5.5与Claude Opus 4.8工作风格对比 — ArtificialAnlys · 2026-07-07