MerchantBench 用 365 天电商仿真测试 LLM agent
dair_ai · x · 2026-08-04
MerchantBench 提出了一种365 天的仿真评测,用来衡量 agent 在电商运营里的长期一致性,而不是只看单步任务是否完成。\n\n- 基于 98,843 条真实商品记录\n- 提供 26 个工具,覆盖选品、上架、定价、现金流管理和延迟反馈处理\n- 评分方式按累计净资产计算,因此前期失误会不断累积,而不会被平均掉\n- 作者用 8 个 LLM、2 套 agent 框架,做了 48 次完整的 365 天游走仿真\n- 最好的配置,最终净资产也只达到人类基线的 27.3%
「编程与Agent」频道最新
- Gemini Spark 已能接 MCP,但每个工具都得反复授权 — tristanbob · 2026-08-04
- Agent 应用该先暴露技能面,再逐步固化成代码 — burny_tech · 2026-08-04
- 同一个 session 里可用 subagent 切换模型 — dotey · 2026-08-04
- xAI 用 Grok 4.5 升级 Grok Build,加入技能和计划模式 — elonmusk · 2026-08-04
- 自定义搜索 RL 训练,可能比“单一大模型”更有效 — shangbinfeng · 2026-08-04
- GitHub Copilot CLI 1.0.78 增加实时耗时与新 worktree 命令 — copilot-cli-release-app[bot] · 2026-08-04