阿里 Accio 发布 CommerceAgentBench:107 个真实电商任务验证智能体执行

future_coded · x · 2026-08-28

Accio 基于阿里巴巴 27 年电商经验发布 CommerceAgentBench,主张大多数 AI 基准测「模型说什么」,而这个基准测「模型做什么」。基准包含 300 封含噪声邮件、实时货运平台、真实浏览器会话和实际预订 ID,覆盖采购、定价、物流、会议与审计等场景。

107 个任务提炼自 1000 万中小企业用户、160 万对话、20 万条轨迹,每个答案通过模型在真实系统中实际提交的结果验证,而非摘要或框架。示例包括埋有 BEC 欺诈的 Gmail RFQ 分诊、带 30 天硬性时限的 FreightOS 东莞→达拉斯货运路由——漏算一项费用或超出运输时限即判失败。作者的结论是:能在生产环境胜出的智能体都会留下执行轨迹,现在有了检查这些轨迹的基准。

所属事件:阿里 Accio 开源电商智能体基准 CommerceAgentBench(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →