阿里开源电商智能体基准:107 真实任务,顶尖模型失败率超 40%
iamfakhrealam · x · 2026-08-26
阿里 Accio 团队发布了号称“史上最难”的电商智能体基准测试 CommerceAgentBench。
- 数据来源:基于阿里巴巴 27 年的真实电商数据构建,包含 107 个真实的业务任务。
- 任务特点:测试智能体执行长周期业务工作流的能力,而非简单的问答。
- 测试结果:目前排行榜上表现最好的模型准确率仅为 61.68%,意味着仍有 41 个真实业务任务无法完成。这揭示了当前 Agent 在实际商业落地中的巨大能力缺口。
- 开源贡献:团队呼吁社区贡献更多模拟环境和更难的任务集。
所属事件:阿里开源电商Agent基准,最强仅完成61.68%(7 条相关)→
「编程与Agent」频道最新
- Row-Bot 更新:推出可视化技能发现与 UI 交互系统 — Acceptable-Object390 · 2026-08-26
- 引入任务分级机制,大幅降低 AI 编程 Agent 的 Token 消耗 — jbarbier · 2026-08-26
- 用 AI Agent 构建确定性自动化工作流的新实践 — Lecontodereddit · 2026-08-26
- 实测显示 82.8% 的 AI Agent 无法被其他 Agent 调用 — Sufficient-Pie6680 · 2026-08-26
- MCPay:给远程MCP服务器加按次计费网关,治住失控Agent — TooDu0 · 2026-08-26
- SpaceXAI 工程师演示 GrokBot:用 Agent 团队自动修 Bug — dean_rie · 2026-08-26