AutomationBench-AA发布:评估AI自动化SaaS工作流能力

Artificial Analysis联合Zapier推出了全新的自动化能力基准AutomationBench-AA,并配套发布了arXiv论文、GitHub仓库与Zapier排行榜。该基准旨在测试AI agent能否在遵守业务规则的前提下,自动化真实的SaaS工作流,为业界评估大模型的工具调用与自动化编排能力提供了新标准。

评测机制与任务难度

AutomationBench-AA包含657个工作流自动化任务,覆盖金融、HR、营销、运营、销售和支持六大业务领域。模型需要通过REST API在40个模拟的SaaS应用环境中进行跨应用工作编排,最终根据系统状态的完成度进行程序化评分。任务难度因领域而异,其中财务工作流最难自动化,所有模型合计仅完成约三分之一的财务目标,大约是客服和运营领域(约60%完成率)的一半。

模型表现与成本差异

在自动化执行风格上,不同模型差异显著。例如,GPT-5.5(xhigh)偏向密集操作,平均每个任务调用49次工具、跨25轮完成;而Claude Opus 4.8(max)则更为审慎,工具调用集中在14轮内(平均35次)。此外,各模型的单任务成本相差超过一个数量级:DeepSeek V4、Gemini 3.1 Flash-Lite和Qwen3.7 Plus的单任务成本低于5美分,而Claude Opus 4.8(max)接近1.5美元。不过,成本高并不绝对等同于表现好,领先者并非总是最贵的。

护栏违规与效率排名

除了完成目标,agent还必须避免触发代表业务规则的护栏。评测显示,所有参评模型在发布时都会触发不同程度的护栏违规。若按“每违规一次所完成的有效目标数”来调整效率排名:Gemini 3.5 Flash表现最佳(每违规完成15.0个目标),Claude Opus 4.8(max)紧随其后(13.5个),而Claude在整体操作中的护栏违规相对更少(每任务0.次,此处依原帖数据表述)。

2026-07-07 ~ 2026-07-07 · 7 条相关

一手来源