Qwen 团队发电商 Agent 基准:18 个前沿模型跑全年模拟无一家全面领先
dair_ai · x · 2026-09-02
Qwen 团队发布 E-Commerce Bench:让 Agent 在模拟 365 天中同时运营多家在线商店,对 18 个前沿模型按 7 个维度打分。
- GPT-5.6 Sol 赚钱最多,把 10 万初始资金做到 1,431,425,但欺诈规避维度仅排 18 名中的第 16,运营效率也不及 Fable 5。
- 开源权重模型中 Qwen3.8-Max-Preview 以 416,252 领先,高出 GLM 5.2(high)约 38%,且在长期运营中学习性最强——能通过反复下单逐步把供应商价格压下来。
- 没有任何单一模型在所有维度上占优。适合需要跨 session 长期评测 Agent 的研究者阅读。
「模型」频道最新
- OpenAI 发布网络安全模型 Astra,达关键级阈值 — OpenAI · 2026-09-02
- 观察:AI 语音模式下回复变简洁,适应人类倾听习惯 — joshwhiton · 2026-09-02
- Anthropic 被指回溯为旧版 Opus 模型加强防护 — LordCoice · 2026-09-02
- 泄露显示 Claude.ai 系统指令长度已达 13.8 万 token — frubberism · 2026-09-02
- 实测 Fable 5.1 生成成本超 GPT-5.6 六倍,细节更丰富 — rohanpaul_ai · 2026-09-02
- 实测 Fable 5.1 贵 6 倍:画质更细腻但仍犯低级错误 — rohanpaul_ai · 2026-09-02