15 个大模型开跨境电商店,最强也赚不到人类策略的一半

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

cs.AI

2026-08-09

Business Arena 让 15 个大模型开跨境电商店,最强模型净赚 18.8 万美元,仅为人类手写策略四成,过半场次亏本。

这篇在解决什么

现有的 agent benchmark 大多把任务切成窄流程:写几行代码、订一张机票、查一个数据库。把大模型放进一个需要长期经营、资金有沉淀、回报有延迟、市场还在变的环境里跑,几乎没有像样的评测。这篇要补的就是这块。

作者把「做生意」拆成四件难事:你看到的永远是部分信号,真实需求、对手意图、客户偏好都藏着;今天投的钱要等货卖出去才知道对不对;需求、成本、对手每天都在变;与此同时合规、客服、固定开支这些必须一直兜着,漏一项就罚钱。这四件事叠在一起,单看某一步决策很难判断好坏,只有最后赚不赚钱是干净的信号。

方法

Business Arena 让一个 agent 接手一家跨境电商店,跑 30 个模拟营业日。每天它可以看市场情报、调价格、进货、投放广告、管现金流、回复买家和供应商询盘,然后调 endround 推进一天。一个 episode 下来要调用超过 60 个工具,走完整个商业循环。

环境的底子是真的。供应商端来自阿里巴巴国际站脱敏数据,965 条供货报价、831 家供应商、135 个品类,带国家、单价、起订量、库存、交期、宣传质量等属性,供应商价格会跟着日历、宏观、产能压力和突发事件波动。需求端用美国人口普查零售月报、欧盟 Eurostat、中国国家统计局零售数据加 Google Trends 校准;关税用世界银行 WITS 数据库,还按历史上中美贸易摩擦做了冲击。对手是 60 个脚本 NPC 卖家,分 10 种原型(价格领袖、跟风者、清仓者、机会主义者、高端、跨境、批发、事件狙击手、新进入者、休眠者),跨 5 个规模档,模拟真实生态。

钱算得很细。期末净资产 = 现金 + 0.97×托管金 + 0.97×应收 + 0.85×库存 − 应付 − 贷款。摩擦项也齐全:每天 200 美元固定开支外加库存价值 0.5%、平台佣金 5%12%、短期贷款日息 0.15%(逾期涨到 2.5 倍)、供应商应付逾期日息 0.10%、合规罚款 max(500, 15%×订单额)×min(违规次数, 5)。

光看利润说不清为什么赢为什么输,所以作者配了三层诊断。技能级指标看资金周转、库存周转率、订单毛利、售罄率、买家转化、回复准确率、RFQ 成交、违规与罚款。动作级归因把每一笔盈亏顺着经济流转追回到产生它的那个模型动作。机制消融用来排除「模型其实是靠偷懒或钻空子拿高分」:把模型该做的正确行为替换成忽视或滥用策略,看净值掉多少。

结果

论文评了 15 个前沿模型,闭源一组、开源一组。结论很硬。

最强的 Gemini 3.1 Pro 平均期末净资产 188,488 美元,最弱的 MiniMax M2.5 只有 20,856 美元,差 9 倍。起点资金是 80,000 美元,但 51% 的运行其实是亏本的,只有 4 个模型能在每次试验里都保住本金。可靠性也过关:跨次一致性 ICC=0.944,任意拆两组各五次重复跑,排名相关 ρ=0.898。

人手写的专家策略能做到 436,195 美元,是最强模型的两倍多。这条结论最关键:模型离「能做生意」还差一个量级。

技能级分析看出不同模型各有经营风格。Gemini 3.1 Pro 是「高端铺子」,累计资金用到 199%,平均订单毛利 52.0%,宁可售罄率低也要保毛利。GPT-5.6 Sol 是「走量批发商」,资金用 167%,库存周转接近 1.0,售罄率 93% 以上,拿毛利换量。Fable 5 是各项均衡的卖家。Qwen 3.7 Max 是「投资不足的店」,只动用了 22.3% 的本金。MiniMax M3 是「卡住的店」,周转 0.36、毛利 12.1%、售罄率不到 40%。Opus 4.8 是「客服专家」,询盘转化率全场最高 84%,但整体经济性一般。

合规也是分水岭。强模型基本干净:Fable 5 和 GPT-5.5 没有任何受罚违规,GPT-5.6 Sol 和 Gemini 3.5 Flash 接近干净。弱模型堆违规:MiniMax M2.5 平均 22.7 次违规、被罚 51,750 美元,DeepSeek V4 Pro 平均 17.4 次违规、被罚 39,650 美元。

机制消融给出「分数是真的」的证据(均值相对基线的净值变化):按证据选货 +63.6k,闭眼批量买 −14.6k;看市场事件 +6.6k,无视事件 −17.3k;全成本定价 +50.3k,贴成本定价 −58.1k;关税敏感选路线 +25.9k,关税盲只盯美国 −3.7k;认真回询盘 +5.6k,无视询盘 −0.1k。正负一拉,说明高分确实是商业判断带来的,不是靠忽视任务或钻模拟器空子。

为什么重要

对做 agent 的人来说,这是一个少见的、用真钱算账的长期环境。它把「agent 能不能完成多步任务」往前推了一步,推到了「能不能在延迟回报、资金约束、对手博弈里持续经营」。如果要评估一个通用 agent 的实际可用性,把它扔进这种环境跑 30 天,比再刷一轮 SWE-bench 更能暴露短板。

对想用 agent 做生意的人来说,结论是冷静的:当前最强的模型也还远不如一个写死的专家策略。这意味着现阶段的合理用法不是放手让它全自动经营,而是把它放在选品、定价、关税路线这类有明确判断标准的环节上,剩下的交给规则和人。论文里 Gemini 的路线感知改价器守住 15% 毛利下限、GPT-5.5 检测到现金归零自动清库存这类行为,就是这种半自动打法能复用的样板。

局限与存疑

作者自己点了三条:环境抽象掉了真实操作系统(GUI、第三方平台、活的店铺前台);目前只覆盖跨境 B2B 这一个场景,做生意远不止这一种;生产级评测还需要让 agent 在不断变化的真实接口上安全执行决策、承担真实副作用。第三条尤其实在,这是个沙盘,不是真店。

读完还有几处存疑。一是 NPC 卖家全是脚本,10 种原型再分档也只是对真实卖家的粗粒度近似,真实对手会学习、会针对你调整,这层博弈在沙盘里基本没有。二是需求是用宏观数据校准的合成需求,和真实买家询盘的随机性、谈判拉扯不是一回事。三是 30 天这个时长对「长期经营」来说偏短,复利和品牌效应这类需要更长时间才显现的因素测不到。四是论文比的是模型裸跑,没给模型加专门训练或工具链优化,这更像起跑线快照而非能力上限。

术语

原文与代码

相关论文

全部论文解读