阿里 MerchantBench 揭示电商智能体与人差距
alibabagroup · hf · 2026-08-05
阿里巴巴发布了 MerchantBench,一个专门评估大语言模型智能体在电商运营中长期连贯性的基准测试。
测试背景与机制
- 现有基准多关注有界任务,而真实部署需要智能体在长期范围内保持目标导向行为,并根据积累的证据调整决策。
- 该测试基于 98,843 条真实电商产品记录,构建了 365 天的订单级模拟环境。
- 智能体可使用 26 种工具,需处理产品采购、上架定价、现金流管理等复杂任务。
评估结果
- 研究团队在 48 次运行中评估了 8 个 LLM。
- 结果显示,即使是最新的大模型,其表现也远不及人类参与者。
- 表现最好的 LLM 配置最终净资产均值仅达到人类参与者的 27.3%。
所属事件:阿里推出MerchantBench评测电商智能体(3 条相关)→
「编程与Agent」频道最新
- 自我改造 harness 风险:谁出考卷、谁验 diff 才是关键 — sujingshen · 2026-09-22
- 15 个 Claude Skills 精选合集,Blender 可直接从对话提示词调用 — Div_pradeep · 2026-09-22
- KeycardAI CEO:AGI 不是瓶颈,信任与身份才是 — brucemacv · 2026-09-22
- 横评 6 个 agent harness 项目:分四类讲清各自适用场景 — bishopZ · 2026-09-22
- Reddit 热传 AI 编程 Agent 精选仓库清单,网友整理出直达链接 — alexcovo_eth · 2026-09-22
- 同一 prompt 跑遍多框架,工具并排对比 agent 执行轨迹 — AU1CII · 2026-09-22