AgentWorld 基准:最强模型多智能体长程协作成功率仅 52%
Raphael Shu · hf · 2026-09-28
AgentWorld 是一个评测 LLM 多智能体长程协作能力的开源基准,揭示当前模型在协作上远未过关。
- 设计:100 个人工标注任务(含 100 个增强变体),设置在 MMORPG 沙盒中,需 3-20 个角色与能力不对称的 agent 进行 50+ 轮交互,通过通信、联合规划与资源共享完成目标;黑盒设定下每个 agent 无法访问他人内部状态。
- 新指标:提出 CCE(因果协作有效性),用图结构追踪 agent 行为间的因果依赖,衡量团队努力中真正贡献于结果的比例,而非只看二元的任务成败。
- 结果:测试 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 与 DeepSeek R1-70B,最好的模型任务成功率也只有 52.0%,典型失败模式包括沟通中断、角色混乱、无法跨轮维持共享计划。
- 项目完全开源。
「编程与Agent」频道最新
- Reddit 用户开发 McpBrowser:复用本机 Chrome 登录态绕过 Claude 抓取限制 — bishwasbhn · 2026-09-28
- Anthropic 设计负责人畅想:Agent 表达力遇上类 Google Docs 编辑界面 — jeff_weinstein · 2026-09-28
- 开发者开源 VelaTerm:一个桌面应用统一管理多家编码 Agent 会话 — george-lin · 2026-09-28
- 2170 个开源项目实证:Jev 决策模型生态快速扩张但关注错位 — CUHK-CSE · 2026-09-28
- Anthropic 发布 37 分钟免费教程:教工程师构建自主 AI Agent — Aiden_Tech_Ai · 2026-09-28
- Spotify 论文:合成多轮对话+自改进循环,对话推荐质量提升 8% — _reachsumit · 2026-09-28