全新LLM多智能体协调基准:多数模型表现不佳

ktessera · reddit · 2026-07-14

研究团队提出了一个全新的基准测试,用于评估语言模型在长周期、开放式世界中的多智能体协调能力。在该环境中,智能体需要相互配合完成探索、交流、资源交易、工具制造、建筑和战斗等复杂任务。

核心发现:

项目已开源并提供交互式轨迹演示。

所属事件:多项研究揭示LLM多智能体协作表现不佳(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →