阿里提出 MerchantBench:大模型电商运营长期能力评测
_akhaliq · x · 2026-08-06
MerchantBench 是一个全新的基准测试,专门用于评估大语言模型(LLM)智能体在电商运营中的长期连贯性。
- 测试环境:模拟为期 365 天的订单级电商运营,基于 98,843 条真实产品记录。
- 智能体工具:为智能体提供 26 种商家工具,涵盖选品采购、动态定价、订单追踪和现金流管理等环节。
- 评估挑战:测试智能体在面对供应商中断、退款、差评和罚款等延迟结果时的应对能力。
- 论文及代码已开源。
所属事件:阿里推出MerchantBench评测电商智能体(3 条相关)→
「编程与Agent」频道最新
- JevHarness:LLM 自动生成决策 harness,冻结后极速执行 — sujingshen · 2026-09-22
- 自我改造 harness 风险:谁出考卷、谁验 diff 才是关键 — sujingshen · 2026-09-22
- 15 个 Claude Skills 精选合集,Blender 可直接从对话提示词调用 — Div_pradeep · 2026-09-22
- KeycardAI CEO:AGI 不是瓶颈,信任与身份才是 — brucemacv · 2026-09-22
- 横评 6 个 agent harness 项目:分四类讲清各自适用场景 — bishopZ · 2026-09-22
- Reddit 热传 AI 编程 Agent 精选仓库清单,网友整理出直达链接 — alexcovo_eth · 2026-09-22