GPT-6 Astra 登顶 Zapier AutomationBench:41.4% 首破 40% 大关
sandersted · x · 2026-09-04
Zapier 在其 AutomationBench 基准上测得 GPT-6 Astra 创下历史最高分。
核心数据
- Astra 以 Max effort 得分 41.4%,此前没有任何模型突破 40%(上代最高 GPT-5.6-Sol 为 28.8%)
- AutomationBench 用 47 个真实工具、覆盖 Sales/Marketing/Operations/Support/Finance/HR 六大业务职能,测试 agent 在 CRM、邮件、日历等隔离环境中的端到端任务执行,按最终环境状态做确定性打分,不用 LLM 评委
- 现有榜单:Claude Fable 5.1+Opus 5 回退组合 31.4%($2.45/任务)、Gemini 3.7 Flash 30.44%($0.61)、GPT-5.6 Sol 28.77% 等
强弱项
- 最适合:对账、交易审查准备、供应商记分卡等「动错记录代价高」的任务;优势在于跨杂乱数据源的算术与信息查找(政策文档、修正记录、例外规则)
- 较弱:指引分散的对外沟通;Operations 与 Support 是最强领域,HR 最弱
- 示例任务:根据上季度实际数据、邮件中的财务调整与渠道资格规则重新分配季度媒体预算,两模型总额一致,Astra 找到了被埋没的细节
「编程与Agent」频道最新
- xAI 官方长文:为「持久智能体」重新设计 Grok Bot 的交互范式 — soleio · 2026-09-04
- antirez:评价新模型别看 three.js demo,看它能否解决真实阻塞难题 — antirez · 2026-09-04
- 在 Gemini Enterprise 内跑通 MCP App,实时展示 Cloud Run 服务 — rseroter · 2026-09-04
- xAI 推出 Grok Bot 企业版,对 Grok 与 Cursor 企业客户免费两周 — mattyp · 2026-09-04
- Perplexity 宣布 Astra 擅长计算机使用,将接入 Comet 浏览器 — AravSrinivas · 2026-09-04
- OpenAI 发布 GPT-6 Astra 开发者实测:3D 伦敦史与并行 Agent 破解 DEF CON 谜题 — OpenAI · 2026-09-04