MerchantBench 用 365 天电商仿真测试 LLM agent
dair_ai · x · 2026-08-04
MerchantBench 提出了一种365 天的仿真评测,用来衡量 agent 在电商运营里的长期一致性,而不是只看单步任务是否完成。\n\n- 基于 98,843 条真实商品记录\n- 提供 26 个工具,覆盖选品、上架、定价、现金流管理和延迟反馈处理\n- 评分方式按累计净资产计算,因此前期失误会不断累积,而不会被平均掉\n- 作者用 8 个 LLM、2 套 agent 框架,做了 48 次完整的 365 天游走仿真\n- 最好的配置,最终净资产也只达到人类基线的 27.3%
所属事件:阿里推出MerchantBench评测电商智能体(3 条相关)→
「编程与Agent」频道最新
- 给 LLM 套缰绳:作者开源受限 shell 的 MCP server 防模型写坏文件 — ag789 · 2026-09-22
- 爆料:OpenAI、Anthropic、Cognition 下月齐发个人 Agent 平台 — altryne · 2026-09-22
- 一条判据定 Agent:运行前写得清步骤的都不该用 Agent — Virtual_Hair_1987 · 2026-09-22
- Teknium 合并修复:Hermes Agent 桌面端无法识别模型插件问题解决 — Teknium · 2026-09-22
- 借 90 年代多智能体系统反思:用信念建模取代中心编排器 — nptacek · 2026-09-22
- Grok 4.7 编码评测大涨:CursorBench 40.4%→46.3%,价格不变 — FinanceYF5 · 2026-09-22