MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo
cs.AI
2026-07-31
阿里用 9.8 万真实商品搭 365 天开店仿真,8 个大模型当店主,最好的只赚到人类玩家 27% 的净资产,瓶颈全在长程一致性。
现在的 agent 基准大多测的是「单次任务能不能做对」,给个目标,看一步到位。真实部署里 agent 要跨很长一段时间维持目标一致:今天的决定会约束明天的选择,反馈还常常姗姗来迟。这种「长程一致性」缺一个能稳定测的环境。作者选了卖家侧电商这个场景,因为开店天然是循环且互相依赖的决策:采购、上架定价、现金流、反馈适应四件事彼此咬合。
MerchantBench 是一个按订单粒度推进的 365 天仿真,共 8760 个小时步,每 12 步开一次决策窗口(一天两次)。底座是 1688 上 98,843 条真实商品记录,初始给 2000 元现金加 1000 元保证金,最多挂 50 个在售商品,保证金耗尽即终止。agent 通过 26 个工具与环境交互,覆盖四类:上游拿日报、搜商品、查供应商,下游查订单、订单更新、订单详情,控盘上下架、调价,以及财务查询。
设计的核心是时序不对称:下单立刻扣现金、供应商事件立即可见,但订单的异常结果(取消、缺货、迟发、仅退款、退货退款、差评这六类)要等一段时间才浮现。agent 必须跟踪单笔订单的生命周期,回头改早先的决定。测试矩阵是 8 个大模型(GPT-5.6 Sol、Claude Opus 4.8、Qwen3.7-Max 与 Plus、GLM-5.2、DeepSeek-V4-Pro 与 Flash、Kimi K2.6)乘 2 种框架(最小 ReAct、带代码执行与记忆的 Hermes),每个组合跑 3 次共 48 局,并配规则 agent 和 3 名人类玩家做基线。
最好的大模型配置(Qwen3.7-Max 加 Hermes)365 天后净资产 5.95 万元,人类玩家均值 21.76 万元,大模型只到人类的 27.3%。各模型净资产(千元)一览:
| 模型 | ReAct | Hermes |
| Qwen3.7-Max | 20.66 | 59.46 |
| GPT-5.6 Sol | 40.89 | 52.93 |
| GLM-5.2 | 25.73 | 42.32 |
| Claude Opus 4.8 | 31.89 | 35.56 |
| DeepSeek-V4-Flash | 14.47 | 24.69 |
框架影响很大:Hermes 平均净资产比 ReAct 高 53.3%,GMV 高 71.5%,订单多 71.2%。人类玩家的持续活跃窗口率(SWR)是 100%,大模型从 10.6% 到 99.4% 不等。失败模式很具体:活动衰减、控制回路收窄到只处理供应商事件、记忆出错(Hermes 上的 Claude Opus 4.8 因错误推断把在售商品从 47 个砍到 3 个)、时间错乱(Qwen3.7-Max 在第 282 天误记第 285 天是终点,提前 83 天停止补货)、退款后不改商品、需求匹配差。最离谱的是 Hermes Kimi K2.6,第 104 天判断店铺救不回来,之后 523 个决策窗口里有 355 个完全不操作。
这是为数不多把 agent 放进「长时段、动作会约束未来、反馈延迟」的真实环境里压测的工作。对做 agent 框架的人,Hermes 比 ReAct 全面更好说明:在长程任务上,规划、记忆、技能管理这类脚手架比换更大的模型更值钱。对评测方向的人,它提供了一个能稳定复现的长程基准,而不是又一次刷新单任务榜单。
人类基线只有 3 人,而且都没有电商经验,「人类水平」本身参考意义有限。商品池来自单一平台(1688)和单一时间段,固定目录可能让仿真比真实世界更可控。作者没有单列局限小节,但保证金耗尽即终止、最多 50 个在售商品等机制都是人为设定。
读下来还有两点:Hermes 自带代码执行和记忆,它比 ReAct 强有多少归功于脚手架、多少归功于给 agent 的信息更全,论文拆得不够细。另外 48 局、每组 3 次的样本对长程这种高方差任务偏小,模型间排序的稳定性需要存疑。