Gemini 3.7 Flash 登顶 Zapier Agent 榜单,性价比远超 Claude 与 GPT
_philschmid · x · 2026-08-14
Zapier 发布的 AutomationBench 基准测试旨在评估大模型在真实业务工作流中的端到端执行能力,覆盖销售、营销、运营、支持、财务和 HR 六大领域的 47 个真实工具。
在最新榜单中,Gemini 3.7 Flash 以 30.44% 的正确率和仅 $0.61 的单次任务成本位列第一,超越了成本更高的 Claude Opus 5 和 GPT-5.6 Terra。它在营销、财务、销售和支持领域表现最佳,但在运营领域不及 Claude Opus 5。
「编程与Agent」频道最新
- Databricks 推出 Unity AI 网关智能路由,声称可降 30%+ 任务成本 — matei_zaharia · 2026-08-14
- DAB 基准测试:真实还原混乱数仓,揭示前沿模型的数据分析短板 — HamelHusain · 2026-08-14
- 开发者实测:DSH 框架在复杂项目上展现极高效率 — ChrisGPT · 2026-08-14
- Entire取消等待名单:为AI编码代理打造的Git托管平台正式开放 — craigsdennis · 2026-08-14
- Prime Agent开源:能自我重写提示词与记忆的递归智能体 — JeremyCMorgan · 2026-08-14
- Toast 1 搜索智能体实测:质量与速度兼得,价格仅十分之一 — xeophon · 2026-08-14