多项研究揭示LLM多智能体协作表现不佳

近期围绕大语言模型(LLM)多智能体能力的多项研究集中给出了偏谨慎的结论:无论是在长时程开放世界里的协作任务,还是在代理之间相互试探、发现彼此能力边界的互动上,现有系统整体表现都不理想。这值得关注,因为多智能体常被视为扩展LLM任务能力的重要方向,但这些结果显示“多一个agent”并不自动带来更好的协作效果。

开放世界协作基准

研究团队提出了一套全新的多智能体协调基准,用于评估13个现代LLM代理在长周期、开放式世界中完成探索、沟通、资源交易、工具制造、建筑和对抗怪物等复杂任务的能力。多条帖子转述的核心结果一致:大多数代理表现很弱,平均标准化回报只有约6%。这表明在需要长期规划与分工配合的环境里,现有模型离稳定有效的协作仍有明显差距。

为何协作会失灵

据@uw-madison介绍,另一项工作将问题聚焦于“多智能体LLM为什么不会彼此探索”。作者指出,当前代理在互动时常表现出过于短视、互动模式容易极化、协调变差并带来更高regret等现象,其核心问题在于它们难以通过互动充分摸清彼此的能力与边界。

相关对比发现

同簇帖子还提到一项被转述的ICML 2026论文发现:在对15个前沿LLM的实验中,某些任务上单个agent可达到80.7%的准确率,而多智能体配置反而表现更差。几项结果合在一起,指向同一个信号:当前LLM多智能体系统的瓶颈,不只是模型本身的强弱,更在于探索、协调与信息交换机制本身存在缺陷。

2026-07-14 ~ 2026-07-15 · 6 条相关

一手来源

另有 1 条近重复转述:weballergy