CommerceAgentBench发布:测试AI Agent能否完成真实电商任务
alifcoder · x · 2026-08-26
传统的AI基准测试关注模型能否给出正确答案,而CommerceAgentBench关注AI Agent能否实际完成工作。该基准将于8月25日在GitHub上线,包含107个真实电商任务,涵盖采购、产品上架、运营、履约和售后等环节。其中一个采购测试展示了这种区别的重要性。
所属事件:阿里开源电商Agent基准,最强也仅完成六成任务(3 条相关)→
「编程与Agent」频道最新
- 开发者分享构建 Agent 编排应用的 Vibecode 体验 — willcb · 2026-08-26
- NVIDIA 宣称 Rubin 架构 Agent 吞吐量提升 30 倍 — Crescitaly · 2026-08-26
- xAI 发布 Grok Bot:能登录工具自主干活的同事 — tetsuoai · 2026-08-26
- 不满官方扩展锁死单家模型,开发者自建跨agent浏览器控制工具Conduit — PumpkinNarrow6339 · 2026-08-26
- 16GB显存跑27B:OpenCode+Qwen3.8本地编码完整配置教程 — Due-Project-7507 · 2026-08-26
- 开源Qwen-DAP-MCP:让本地Qwen真正上调试器逐步改代码 — Additional_Reach2545 · 2026-08-26