多项研究揭示LLM多智能体协作表现不佳
近期围绕大语言模型(LLM)多智能体能力的多项研究集中给出了偏谨慎的结论:无论是在长时程开放世界里的协作任务,还是在代理之间相互试探、发现彼此能力边界的互动上,现有系统整体表现都不理想。这值得关注,因为多智能体常被视为扩展LLM任务能力的重要方向,但这些结果显示“多一个agent”并不自动带来更好的协作效果。
开放世界协作基准
研究团队提出了一套全新的多智能体协调基准,用于评估13个现代LLM代理在长周期、开放式世界中完成探索、沟通、资源交易、工具制造、建筑和对抗怪物等复杂任务的能力。多条帖子转述的核心结果一致:大多数代理表现很弱,平均标准化回报只有约6%。这表明在需要长期规划与分工配合的环境里,现有模型离稳定有效的协作仍有明显差距。
为何协作会失灵
据@uw-madison介绍,另一项工作将问题聚焦于“多智能体LLM为什么不会彼此探索”。作者指出,当前代理在互动时常表现出过于短视、互动模式容易极化、协调变差并带来更高regret等现象,其核心问题在于它们难以通过互动充分摸清彼此的能力与边界。
相关对比发现
同簇帖子还提到一项被转述的ICML 2026论文发现:在对15个前沿LLM的实验中,某些任务上单个agent可达到80.7%的准确率,而多智能体配置反而表现更差。几项结果合在一起,指向同一个信号:当前LLM多智能体系统的瓶颈,不只是模型本身的强弱,更在于探索、协调与信息交换机制本身存在缺陷。
2026-07-14 ~ 2026-07-15 · 6 条相关
一手来源
- 全新LLM多智能体协调基准:多数模型表现不佳 — ktessera ·
- 多智能体LLM缺少探索能力 — uw-madison ·
- 研究称多智能体不如单模型 — josephseering ·
- 【源头】研究称多智能体不如单模型 — josephseering · 2026-07-14
- 多智能体LLM难以彼此探索 — SharonYixuanLi · 2026-07-14
- LLM多智能体协作基准出炉 — j_foerst · 2026-07-14
- 【源头】全新LLM多智能体协调基准:多数模型表现不佳 — ktessera · 2026-07-14
- 【源头】多智能体LLM缺少探索能力 — uw-madison · 2026-07-15
另有 1 条近重复转述:weballergy