开源 CommerceAgentBench,Qwen 跃居开源模型榜首
Alibaba_Qwen · x · 2026-09-01
阿里 Accio 团队开源了 CommerceAgentBench,这是一个针对真实电商操作的 Agent 基准测试,在高保真、有状态的真服务副本中运行。
核心发现:
- 目前最佳的整体完成率仅约 62%,说明 Agent 执行是难点。
- Qwen3.8-Max 在参评开源权重模型中表现最强。
- 该基准旨在测试模型在真实商业工作流中的执行能力,而非仅仅回答问题。
所属事件:阿里 Accio 开源电商 Agent 基准,Qwen 居开源榜首(3 条相关)→
「编程与Agent」频道最新
- VibeKit MCP 服务器:支持部署监控与无头编码 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- 大数据集 MCP 服务器如何避免上下文窗口瓶颈 — JuicerSocial · 2026-09-01
- 把LLM引用当监控数据:用Grok Bot做AI搜索排名 — rohanpaul_ai · 2026-09-01
- 搜索配置比模型选型更能影响 Agent 准确率 — RichardSocher · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01