电商Bench让18个模型经营一年,赚最多的GPT-5.6防欺诈排第16

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

cs.LG, cs.CL

2026-08-31

E-Commerce Bench让智能体用10万元经营365天网店。GPT-5.6 Sol赚到143万,防欺诈却排第16;开源里Qwen3.8-Max-Preview以41.6万领先,18个模型里只有两个会越买越便宜。

这篇在解决什么

长程智能体评测大多是有终点的:修一个 issue、点完一套 GUI、交一份作业。持续经营没有终局,环境在变,决策会在现金流里复利,失败模式是失忆、不从经验改策略、以及把钱交给会骗你的对手。Vending-Bench 有谈判但供应商是采样出来的 LLM,跑次不可复现;MerchantBench 和 RetailBench 有真实商品,又去掉了议价和对抗供应商。

通义、港科大和淘天的 E-Commerce Bench 把两边都做成确定性:顾客需求和退货走固定公式,供应商的报价、让步、成交由谈判核决定,LLM 只负责把核的决定说成人话。代码开源。

方法

智能体拿到 10 万元和 2026 年日历,最多同时开四家店,用 18 个工具做调研、议价、上架、发货、退货和提现,目标是年末总资产最大。商品 6886 个、供应商 576 家,来自淘宝天猫日志;152 家带欺诈脚本。日历上有促销、灾害和供应链冲击。钱分三账:银行付成本,销售收入先进入托管,九天后进平台钱包,再手动提现;连续十天银行余额为负即破产。

上下文 12.8 万 token,到 12 万就按组淘汰最旧工具回合,另有最多 20 条的外部记忆。谈判核按对方让步速度变硬,快让步会遇到更硬的对手;成交价必须和核的报价在 0.005 元内对齐,渲染器改不了价格。欺诈分成交前(地板价抬到约 1.5 倍)和成交后(短发 60–70%、残次退货率至少 0.40)。主指标是年末资产,另外六维是谈判质量 CSE+、欺诈支出占比、回撤、单次工具调用利润、可控退货率、重复采购的 AnchorRatio。

结果

18 个模型各跑 5 局,共 90 局,全部在日历结束或破产,没有撞上 4000 回合上限。顶端和底端相差 1264 倍。90 局里 10 局破产,闭源占 6 局。

模型年末资产均值欺诈支出单次工具利润AnchorRatio↓破产
GPT-5.6 Sol143.1 万18.48%363 元1.2170/5
Fable580.5 万3.46%479 元1.5730/5
Claude Opus 4.725.9 万0.12%156 元1.4210/5
Qwen3.8-Max-Preview41.6 万6.13%173 元0.8340/5
Qwen3.5-Plus0.11 万20.11%-92 元1.8604/5

没有模型七维都强。GPT-5.6 Sol 赚最多,防欺诈排第 16,单次工具利润也低于 Fable5。Claude Opus 4.7 谈判和防欺诈最好,利润只在中游。开源第一名 Qwen3.8-Max-Preview 是 4.2 倍本金,比 GLM 5.2 (high) 的 30.1 万高 38%。只有它和 Gemini 3.5 Flash 的 AnchorRatio 低于 1,即重复下单比打乱自己历史成交价更便宜;16 个模型做不到把同一供应商的价谈下去,17 个模型下半年还把更多单交给欺诈供应商。欺诈损失里残次批次占 53.4%,会员费骗局全年只有 3 笔。943/1141 笔欺诈成交发生在已经打过交道的供应商-商品对上。

为什么重要

对评长程智能体的人,这是目前少数把「对手会还价、会骗、环境会变」和「同一局里结果可复现」绑在一起的开放基准。对用模型做业务代理的人,数字更刺耳:会赚钱不等于会识骗,会砍价不等于会记住上次的价。资产榜不能当能力画像。Qwen3.8-Max-Preview 是场上唯一在重复采购上稳定压价的开源模型,这条学习维比它排第五的利润更值得看。

局限与存疑

每模型 5 局,标准差很大,GPT-5.5 资产标准差就有约 62 万,排序对采样敏感。渲染器默认解码会改措辞,防欺诈维带进叙事噪声。需求公式和容量项会吞掉很大一块价格弹性,智能体看到的是被天花板剪过的销量,归因谈判还是选品并不干净。记忆槽几乎没被用起来,经验学不会,有多少该怪驱逐、多少该怪模型不写记忆,分不开。这是中国电商日历和人民币结算,换市场要重校准。没有人类商家基线,14 倍本金算不算会做生意,不知道。

术语

原文与代码

社区讨论

相关论文

全部论文解读