阿里 MerchantBench 揭示电商智能体与人差距
alibabagroup · hf · 2026-08-05
阿里巴巴发布了 MerchantBench,一个专门评估大语言模型智能体在电商运营中长期连贯性的基准测试。
测试背景与机制
- 现有基准多关注有界任务,而真实部署需要智能体在长期范围内保持目标导向行为,并根据积累的证据调整决策。
- 该测试基于 98,843 条真实电商产品记录,构建了 365 天的订单级模拟环境。
- 智能体可使用 26 种工具,需处理产品采购、上架定价、现金流管理等复杂任务。
评估结果
- 研究团队在 48 次运行中评估了 8 个 LLM。
- 结果显示,即使是最新的大模型,其表现也远不及人类参与者。
- 表现最好的 LLM 配置最终净资产均值仅达到人类参与者的 27.3%。
所属事件:阿里推出MerchantBench评测电商智能体(3 条相关)→
「编程与Agent」频道最新
- Rust 包管理器 Cargo 愿景:探讨依赖管理与智能体开发 — charliermarsh · 2026-08-06
- RTX 5090 本地大模型量化与 8GB 显存智能体性能基准测试 — max_paperclips · 2026-08-06
- Muse 推出终端编码智能体 Muse Code 及模型 1.2 版 — shuchaobi · 2026-08-06
- 智能体框架影响准确率超15%,新基准DataSpace揭示短板 — omarsar0 · 2026-08-06
- Meta 发布终端编码智能体 Muse Code 与新模型 — alexandr_wang · 2026-08-06
- Christoph Nakazawa 复盘:与 LLM 协作开发框架的极限体验 — cnakazawa · 2026-08-06