阿里开源电商 Agent 基准 CommerceAgentBench,最强仅完成六成任务
阿里巴巴国际站团队发布并开源了电商 Agent 基准 CommerceAgentBench(GitHub 仓库 Accio-org/CommerceAgentBench,已获 1.2k star),用于测试 AI Agent 能否真正完成真实电商工作,而非仅给出正确答案。基准包含 107 个任务,覆盖采购、产品上架、运营、履约和售后全链路,由阿里国际电商真实数据蒸馏而来,源头包括 1000 万中小企业用户和 160 万完整对话等数据。目前表现最强的 Agent 仅能完成 61.68% 的任务。
已确认
- 基准于 8 月 25 日在 GitHub 上线开源,仓库为 Accio-org/CommerceAgentBench,1.2k star
- 共 107 个真实电商任务,环节覆盖采购、产品上架、运营、履约、售后
- 任务数据由阿里巴巴国际电商真实数据蒸馏而来,涉及 1000 万中小企业用户、160 万完整对话等
- 评分不依据模型自述,而是检查 agent 在环境中留下的真实操作痕迹:标签是否正确应用、草稿是否真正保存、日历事件是否创建,以及商品上架、订单、运单号和跨系统数据是否一致
- 采购任务包含定价难题:供应商报价涉及不同币种、Incoterms 贸易术语、附加费、最小起订量、付款条款和交期,agent 须归一化为可比较的落地成本,否则账面最便宜的供应商未必真便宜
- 采购测试设定为接管约 300 封邮件的采购收件箱,混杂供应商报价、数量修改、交货条款、付款信息、已撤回报价和身份相似的供应商,要求判断哪些信息真实有效并做出采购决策,而非简单总结邮件
为什么重要
- 传统基准关注模型能否给出正确答案,该基准转向考察 Agent 的实际执行能力,按操作结果判分更能反映真实工作场景的表现
- 最强 Agent 完成率仅 61.68%,说明当前 Agent 在复杂真实电商流程中仍有大量提升空间,为行业提供了新的能力标尺
2026-08-26 ~ 2026-08-26 · 5 条相关
一手来源
- CommerceAgentBench发布:测试AI Agent能否完成真实电商任务 — alifcoder ·
- 最强 Agent 仅完成 61.68%:阿里电商基准上线 GitHub — alifcoder ·
- 不看你说了什么:新基准按环境操作痕迹给 Agent 判分 — alifcoder ·
- 【源头】CommerceAgentBench发布:测试AI Agent能否完成真实电商任务 — alifcoder · 2026-08-26
- 300 封邮件里找出真相:基准给 Agent 出采购决策难题 — alifcoder · 2026-08-26
- 多币种多条款报价如何比价:基准考 Agent 算落地成本 — alifcoder · 2026-08-26
- 【源头】不看你说了什么:新基准按环境操作痕迹给 Agent 判分 — alifcoder · 2026-08-26
- 【源头】最强 Agent 仅完成 61.68%:阿里电商基准上线 GitHub — alifcoder · 2026-08-26