MerchantBench 用 365 天电商仿真测试 LLM agent
dair_ai · x · 2026-08-04
MerchantBench 提出了一种365 天的仿真评测,用来衡量 agent 在电商运营里的长期一致性,而不是只看单步任务是否完成。\n\n- 基于 98,843 条真实商品记录\n- 提供 26 个工具,覆盖选品、上架、定价、现金流管理和延迟反馈处理\n- 评分方式按累计净资产计算,因此前期失误会不断累积,而不会被平均掉\n- 作者用 8 个 LLM、2 套 agent 框架,做了 48 次完整的 365 天游走仿真\n- 最好的配置,最终净资产也只达到人类基线的 27.3%
所属事件:阿里推出MerchantBench评测电商智能体(3 条相关)→
「编程与Agent」频道最新
- 开发者观点:当前模型下多 agent 协作对多数任务并无收益 — BLUECOW009 · 2026-09-06
- Codex 一句「写首协奏曲」,5 分钟产出乐谱、动画与真实乐器音轨 — mhmazur · 2026-09-06
- 博主实测多家模型充当子代理,Grok 4.6 与 V4-Flash 入选 — teortaxesTex · 2026-09-06
- 开源 Claude Skills:PubMed/Crossref 自动核查论文引用与数值一致性 — gromads · 2026-09-06
- 免 API 费用本地跑 Claude Code,作者发完整配置教程 — aliscodes · 2026-09-06
- openclaw 之后 HKUDS 推出 nanobot:同核心能力体积小 99% — mdancho84 · 2026-09-06