Google 260 组实验:多智能体可快 80.8%,也可差 70%
alex_verem · x · 2026-07-25
Google Research、DeepMind 和 MIT 做了目前规模最大的多智能体系统对照研究,在 6 个基准、5 种架构、260 种配置 上,用相同工具和算力预算测试了 OpenAI、Google、Anthropic 三家模型。
研究结论非常明确:
- 可并行拆分的任务(如财务分析)里,多智能体团队最高比单智能体 提升 80.8%。
- 强顺序依赖的任务(如规划)里,所有多智能体方案都输给单智能体,最差 下降 70%。
- 没有协调时,智能体会把彼此错误放大 17.2 倍;如果由一个协调器统一合并,错误放大降到 4.4 倍。
- 当单个智能体准确率已经到 45% 左右,再加更多智能体往往开始出现负收益。
这篇论文的核心建议很直接:只有当任务真的能拆成彼此独立的部分时,才值得上多智能体。
所属事件:谷歌大规模实验揭示多智能体系统双刃剑效应(3 条相关)→
「研究」频道最新
- AI 安全研究中对熵表达式解构的反思 — AdaptiveAgents · 2026-08-25
- TiDE-Ab 论文提出时间依赖引导优化抗体设计 — DaveJuergens · 2026-08-25
- 开源交互式教程:深入解析世界模型 — Dooraven · 2026-08-25
- DiffSynth 开源 MiniMax-H3 LoRA 训练适配器与数据集 — bdsqlsz · 2026-08-25
- 阿里发布Swift-Image:6B参数统一文生图与编辑模型 — HaktanSuren · 2026-08-25
- Scaffold CoT:专为小模型设计的 400 万条结构化思维链数据集 — Saraozte01 · 2026-08-25