新基准 AutomationBench:657 个 SaaS 任务考验智能体跨应用编排
gordic_aleksa · x · 2026-09-18
Artificial Analysis 发布 AutomationBench-AA 基准,测量智能体在模拟 SaaS 环境中完成跨应用工作流的能力:657 个任务覆盖金融、HR、营销、运营、销售、支持六大业务域,模拟 Gmail、Google Sheets、Slack、Salesforce、Zendesk、Jira、HubSpot 等应用。
- 任务要求智能体自主发现 REST API 端点、遵守策略文档、向各系统正确写入数据——即跨应用协调 + 自主 API 发现 + 策略遵从三合一
- 与 Zapier 官方 AutomationBench 排行榜(只统计任务完全完成率)不同,AA 版头指标为各任务目标平均完成份额且不触发护栏违规
- 帖子作者感叹 "whale bros mogged the frontier",暗示非前沿厂商模型在该基准上表现抢眼
「编程与Agent」频道最新
- Dosu 实测 Logfire MCP:54 个生产 Agent 调试时间砍 90% — samuelcolvin · 2026-09-18
- Pydantic Logfire 把所有 trace 存成 Postgres 表:Agent 可观测性六步并两步 — samuelcolvin · 2026-09-18
- 被低估的 MCP 用法:让 Claude Code、Cursor 直接读生产遥测 — samuelcolvin · 2026-09-18
- 放弃自回归的 Jev 模型:只输出结构化决策的另类路线 — karminski3 · 2026-09-18
- skilled-proposer v0.2.0:给 GEPA 反思模型加「日志记忆」 — dbreunig · 2026-09-18
- 用户用 agent 按复杂约束一次订好 3 张跨航司机票 — jeff_weinstein · 2026-09-18