CommerceAgentBench 破千星:阿里Accio从160万真实对话提炼电商Agent基准
VibeMarketer_ · x · 2026-09-02
CommerceAgentBench 是一个面向电商场景的 agent 基准,GitHub 已破 1000 星,正成为「agent 能否胜任电商工作」的默认答案。
- 覆盖 107 个任务,横跨采购、商品上架、运营、履约与售后;绝大多数任务要求跨系统执行——从杂乱收件箱或报价单读取信息,再到浏览器、日历或供应商平台完成操作。
- 任务源自真实使用:Accio 为 1000 万中小企业运行 AI agent,这 107 个任务从 160 万真实对话和 20 万执行轨迹中筛选而来,背后是阿里 27 年电商积累。
- 基准假设人类保留决策权,只测 agent 能否在其之下完成执行工作。
「编程与Agent」频道最新
- 后端开发新共识:使用 Effect 而非纯 TS — mattpocockuk · 2026-09-02
- 创业者分享 Grok Bot 实战:自动操作电脑、测试应用,一晚搭建完整工作流 — PrajwalTomar_ · 2026-09-02
- 纸上编程能倒逼你专注细节,而非依赖补全 — TivadarDanka · 2026-09-02
- 用户观点:Claude 缓存降价 75% 利于规模化运行 Agent — Shruti_0810 · 2026-09-02
- Fable 5.1 使用指南:低成本模式与缓存优化 — RLanceMartin · 2026-09-02
- 零成本实现 Pull Request UI 视觉 Diff — zeeg · 2026-09-02