MerchantBench:基于 9.8 万真实商品记录评测智能体长期一致性
rohanpaul_ai · x · 2026-10-02
阿里巴巴团队发布 MerchantBench,一个面向电商卖家运营的 365 天订单级仿真基准,基于 98,843 条真实商品记录构建,配备 26 个工具,考察 LLM 智能体的「长期一致性」(Long-Term Coherence):在延长时间跨度中保持目标性行为、并依据累积证据调整决策的能力。基准将即时可观测的上游供应商事件与延迟到达的下游订单结果耦合,要求智能体跟踪单个订单生命周期并回溯早期决策,涉及选品、上架定价、现金流管理等环节。团队用 2 个智能体框架、每轮 48 次运行(每次 365 模拟天)评测了 8 个 LLM,结果显示模型在长周期任务中普遍表现不佳。
「编程与Agent」频道最新
- Reddit 网友提醒:vLLM/llama.cpp 早已内置免费零样本分类器 — Altruistic_Heat_9531 · 2026-10-02
- 一次成型:开发者用 5.5 一句话生成拳击教练应用 — ZeroStateReflex · 2026-10-02
- 开发者用 Grok Bot、OpenAI Dot 拼出语音编排 Hermes agent 的助理系统 — alexcovo_eth · 2026-10-02
- 整本大书翻译成本几美分:DeepSeek 流水线一小时跑完 — teortaxesTex · 2026-10-02
- OmniSeek:让全模态大模型学会主动“看与听”检索证据 — Haibo Wang · 2026-10-02
- 微软 ActiveSaddler:自动课程学习让 Agent harness 提升 7.5 个百分点 — microsoft · 2026-10-02