Qwen 发布 E-CommerceBench:10 万本金经营网店一年,18 个模型仅 2 个学会压价
千问大模型 · wechat · 2026-09-03
通义千问团队联合淘天集团发布 E-CommerceBench,让 Agent 以 10 万元本金在模拟真实电商环境中经营网店 365 天,评估长程商业决策能力。
环境设计
- 真实脱敏数据:6,886 个商品、60 品类、576 家供应商(152 家欺诈)、12 种店型、全年 10 个市场事件与 8 场促销。
- 时间预算:每天 600 分钟,每次工具调用都扣时间;三账户结算(收入发货后 9 天到账)还原真实现金流压力。
- 关键设计:供应商谈判由确定性内核驱动,LLM 只负责渲染对话——保证可复现,且无法靠越狱把价格砍穿成本线。
核心结果(18 模型 × 5 轮)
- GPT-5.6Sol 年末资产 143 万(14.31 倍)居首,但反欺诈仅排第 16;Qwen3.8-Max-Preview 是开源最佳(4.16 倍),前四名均为闭源模型。90 次评测中 10 次破产,多为 1 月压货导致现金流断裂。
- 谈判:ClaudeOpus4.7 砍价分 0.811 最佳;无模型能压到供应商成本底线。
- 反欺诈差距最大:流向欺诈供应商的采购占比最高与最低相差超 160 倍(0.12% vs 20.11%),分水岭在「聊完后下不下单」。
- 长程学习:18 个模型中仅 Qwen3.8-Max-Preview 的 AnchorRatio(0.88)显示能持续压低进货价,其余模型一年下来反而买得更贵。
- 七维度无模型全绿,前三名各有维度掉出前十;单一总资产指标掩盖真实短板。
团队总结:确定性内核 + LLM 渲染是长程任务评测保持可复现的通用思路;基准远未饱和。
所属事件:Qwen 发布电商智能体基准 全年模拟无一模型全面领先(4 条相关)→
「研究」频道最新
- 从零训练多模态编码器 NeoMME:260M/800M 无视觉塔,主打快 — CShorten30 · 2026-09-03
- LLM 有研究品味吗?Lossfunk 论文用选题任务实测 — paraschopra · 2026-09-03
- 研究显示在线 RL 中动作分块同样显著提升 Contrastive RL 表现 — ben_eysenbach · 2026-09-03
- 编码模型数据枯竭?PL 学者提出「意图计算」新范式破局 — LingmingZhang · 2026-09-03
- davidad 力挺:无约束 RLVR 简单奖励函数应被全面禁用 — davidad · 2026-09-03
- Computerphile 深入讲解 AI 水印原理并现场演示实现 — Computerphile · 2026-09-03