automationbench 基准:astra 正确完成 41.4% 业务工作流创纪录
jdjohnson · x · 2026-09-04
Bryan Helmig 介绍其 agent 评测基准 automationbench:astra 创下新高,在业务工作流中正确完成 41.4%。
评测方法
- 把模型放进模拟应用环境中,给它一个任务,再用代码检查产生的记录与消息结果。
- 难点在于设计能抓住「改错客户」「无视暂停指示」等错误的测试,同时允许 agent 自己找路完成任务。
- 具体做法:准备一组已知的 CRM 记录、邮件、表格行、日历事件等初始状态;提供模拟这些应用 API 的工具;底层是结构化状态——发邮件就往发件箱加消息,改联系人就改记录字段,不会触达真实客户;每次运行使用独立的环境副本。
「编程与Agent」频道最新
- Clanker Cloud 开放免费试用:注册即赠 20 美元额度 — tekbog · 2026-09-04
- Clanker Cloud 亮相:自建 Agent 一条龙,企业销售踩坑实录 — tekbog · 2026-09-04
- 像运营公司一样管 AI:Grok Bot 团队配项目经理分工协作 — FinanceYF5 · 2026-09-04
- AI 找漏洞比修漏洞快,工程师如何应对 CVE 积压 — _jaydeepkarale · 2026-09-04
- AAV 提出在意图与执行间加独立授权层治理 AI Agent — CarlosMarreroAAV · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04