最强 Agent 仅完成 61.68%:阿里电商基准上线 GitHub
alifcoder · x · 2026-08-26
CommerceAgentBench 已在 GitHub 开源(Accio-org/CommerceAgentBench,1.2k star)。107 个任务由阿里巴巴国际电商真实数据蒸馏而来:从 1000 万中小企业用户、160 万完整对话、20 万条商业执行轨迹、2000 个高价值工作流中提炼,并借鉴阿里 27 年电商经验。榜单显示目前最好成绩仅完成 66/107 任务(通过率 61.68%)——模型在聊天中听起来可信,但面对混乱输入、冲突信息、业务规则、多工具与真实执行时仍会出错。团队邀请社区帮忙扩展 mock 环境。作者认为这是 agent 基准应有的方向:少问「AI 说了什么」,多问「AI 实际做了什么」。
所属事件:阿里开源电商 Agent 基准:最强仅完成 61.68%(9 条相关)→
「编程与Agent」频道最新
- Warmwind 演示无需 API,AI 模拟点击操作屏幕 — Med1_Ai · 2026-08-27
- H3 Max 实测:30 秒出 15 秒 768p 视频,成当前最快 — techhalla · 2026-08-27
- 实测用 Grok 加 Magnific MCP 解析视频 Agent — techhalla · 2026-08-27
- 独家用 Claude 写 90+ 文件 Godot 游戏,自测测出渲染 Bug — allpotatoes247 · 2026-08-27
- ChatGPT 桌面端无法识别声明式 WebMCP 工具 — philnash · 2026-08-27
- 悬赏千元求「AI黑话翻译器」:Coding Agent 新方向 — georgemillo · 2026-08-27