阿里开源电商 Agent 基准:107 个真实任务,最强模型也拿不下 41 个
iamfakhrealam · x · 2026-08-26
阿里巴巴国际站 Accio 团队开源 CommerceAgentBench(GitHub 已超 1000 星,当前 v1.3.1),号称最难的电商 Agent 基准。
- 任务来源:从 1000 万中小企业用户 → 160 万完整对话 → 20 万执行轨迹 → 2000 个高价值工作流,筛出 107 个可复现、可检验的任务,覆盖采购、上架、运营、履约、售后等场景,隐去真实名称但保留工作原貌。
- 评分方式:107 个任务横跨浏览器、CLI、API、文件四类环境,不看模型嘴上说什么,只看它实际改变了什么(打了标签、存了草稿、建了日历、写了 JSON),确定性打分,自信的总结不得分。
- 难度示例:Gmail 供应商询价任务需在约 300 封邮件中完成采购甄别——同一家工厂用不同公司名发件、不同工厂名称地址几乎相同、最新报价可能被后续邮件悄悄撤回、6 种贸易术语与 4 种货币混杂,模型必须做真正的实体消解(按地址、电话、银行账户、执照匹配)并把报价归一化为单一可比的单件到岸成本;任务中还埋了一封伪装成供应商例行更新的 BEC 付款 redirection 邮件,误报合法邮件也会扣分,23 项检查逐项打分。
- 结果:Accio 自家排行榜上最好成绩仅 61.68%,最强模型仍有 41 个真实业务任务无法完成——这个差距正是基准的意义所在。
所属事件:阿里开源电商Agent基准,最强仅完成61.68%(7 条相关)→
「编程与Agent」频道最新
- Row-Bot 更新:推出可视化技能发现与 UI 交互系统 — Acceptable-Object390 · 2026-08-26
- 引入任务分级机制,大幅降低 AI 编程 Agent 的 Token 消耗 — jbarbier · 2026-08-26
- 用 AI Agent 构建确定性自动化工作流的新实践 — Lecontodereddit · 2026-08-26
- 实测显示 82.8% 的 AI Agent 无法被其他 Agent 调用 — Sufficient-Pie6680 · 2026-08-26
- MCPay:给远程MCP服务器加按次计费网关,治住失控Agent — TooDu0 · 2026-08-26
- SpaceXAI 工程师演示 GrokBot:用 Agent 团队自动修 Bug — dean_rie · 2026-08-26