AgentWorld 基准:最强模型多智能体协作成功率仅 52%

新智元 · wechat · 2026-10-10

OpenAgents 联合哥大、宾大等高校发布多智能体协作评测基准 AgentWorld:10 个 LLM 驱动的智能体进入 MMORPG 沙盒,拥有不同角色、技能与资源,需通过游戏内聊天和行动完成制作、战斗、采集等任务。任务集含 100 个人工设计任务与 100 个增强变体,需 3-20 个智能体协作,数十轮执行。

设计上有三个关键点:角色不对称(分工与资源传递成为任务一部分)、黑盒交互(无法读取队友内部状态)、多轮执行(须持续同步团队状态)。在统一设置下评测四模型:Gemini3 Flash 主任务成功率 52%、Claude Haiku 4.5 为 45%、GPT-5 Mini 36%、DeepSeek R1-70B 仅 20%。值得注意的是 GPT-5 Mini 平均每任务发 44 条消息成功率却最低,Gemini 发 11 条反而最高——消息数量替代不了协作质量。

论文还提出 CCE(因果协作有效性)指标:从任务完成往回追溯哪些行动真正促成结果。失败分析显示问题多出在协作细节:重复询问、认错接收者、报告错误物品信息、关键步骤未完成就宣布收工。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →