阿里 Accio 发布 CommerceAgentBench:107 个真实电商任务验证智能体执行
future_coded · x · 2026-08-28
Accio 基于阿里巴巴 27 年电商经验发布 CommerceAgentBench,主张大多数 AI 基准测「模型说什么」,而这个基准测「模型做什么」。基准包含 300 封含噪声邮件、实时货运平台、真实浏览器会话和实际预订 ID,覆盖采购、定价、物流、会议与审计等场景。
107 个任务提炼自 1000 万中小企业用户、160 万对话、20 万条轨迹,每个答案通过模型在真实系统中实际提交的结果验证,而非摘要或框架。示例包括埋有 BEC 欺诈的 Gmail RFQ 分诊、带 30 天硬性时限的 FreightOS 东莞→达拉斯货运路由——漏算一项费用或超出运输时限即判失败。作者的结论是:能在生产环境胜出的智能体都会留下执行轨迹,现在有了检查这些轨迹的基准。
所属事件:阿里 Accio 开源电商智能体基准 CommerceAgentBench(2 条相关)→
「编程与Agent」频道最新
- GLM-5.3 开放权重:专攻代理编程与网络防御 — shaunralston · 2026-08-28
- Agent 开发是否陷入重复造轮子的平台税困境? — rio_ARC · 2026-08-28
- 开发者直播:现场构建数据流水线处理日志 — aronchick · 2026-08-28
- Claude 计算机使用能力实测:搞定填表 — HamelHusain · 2026-08-28
- Anthropic 发布 Claude Code 2.1.251 — ClaudeCodeLog · 2026-08-28
- ProductClank 完成首个 Agent 自动交易 — kleffew94 · 2026-08-28