AgentWorld 基准:最强模型多智能体协作成功率仅 52%
新智元 · wechat · 2026-10-10
OpenAgents 联合哥大、宾大等高校发布多智能体协作评测基准 AgentWorld:10 个 LLM 驱动的智能体进入 MMORPG 沙盒,拥有不同角色、技能与资源,需通过游戏内聊天和行动完成制作、战斗、采集等任务。任务集含 100 个人工设计任务与 100 个增强变体,需 3-20 个智能体协作,数十轮执行。
设计上有三个关键点:角色不对称(分工与资源传递成为任务一部分)、黑盒交互(无法读取队友内部状态)、多轮执行(须持续同步团队状态)。在统一设置下评测四模型:Gemini3 Flash 主任务成功率 52%、Claude Haiku 4.5 为 45%、GPT-5 Mini 36%、DeepSeek R1-70B 仅 20%。值得注意的是 GPT-5 Mini 平均每任务发 44 条消息成功率却最低,Gemini 发 11 条反而最高——消息数量替代不了协作质量。
论文还提出 CCE(因果协作有效性)指标:从任务完成往回追溯哪些行动真正促成结果。失败分析显示问题多出在协作细节:重复询问、认错接收者、报告错误物品信息、关键步骤未完成就宣布收工。
「编程与Agent」频道最新
- 10 个防止 AI Agent 泄露密钥与隐私数据的 GitHub 开源仓库 — victor_explore · 2026-10-11
- 开发者实践:常驻 VM 上「dev in prod」跑周报小软件 — davidcrawshaw · 2026-10-11
- GNOME 大版本更新弄坏 dock,AI 助手一小时内修复 — Moarkush · 2026-10-11
- GitHub CEO 分享用 Vibe Coding 打造游戏引擎的过程 — zeeg · 2026-10-11
- 开源 DeepSeek Bot 上线:把 DSH 变成可持久聊天的 Bot 团队 — teortaxesTex · 2026-10-11
- 作者用 ChatGPT 编码渲染出 4K/60fps 音乐可视化 — most_triumphant_yeah · 2026-10-11