Google 260 组智能体实验:收益取决于任务结构
alex_verem · x · 2026-07-25
Google Research、DeepMind 和 MIT 发表了题为 《Towards a Science of Scaling Agent Systems》 的大规模对照研究。研究团队在 260 种配置 上测试了三类模型家族、6 个基准 和 5 种架构,并把工具与算力预算保持一致,尽量只看“协调”本身带来的影响。
研究结论可以概括为四点:
- 适合拆分的任务,多智能体更强。 这类可并行处理的工作里,团队性能最高提升 80.8%。
- 顺序依赖强的任务,多智能体反而更差。 在每一步都依赖上一步结果的任务中,所有多智能体方案都输给单智能体,最差降幅达 70%。
- 协调机制很关键。 没有协调时,智能体彼此会把错误放大 17.2 倍;如果有一个协调器负责合并,放大倍数降到 4.4 倍。
- 存在收益上限。 当单个智能体准确率已经到 45% 左右,再继续加智能体,往往会出现负收益。
论文的核心观点是:多智能体不是“越多越好”,关键先判断任务是否真的能拆成彼此独立的子问题。
所属事件:谷歌大规模实验揭示多智能体系统双刃剑效应(3 条相关)→
「研究」频道最新
- 机器人行为克隆疑案:为何过拟合反而效果更好? — kastnerkyle · 2026-08-25
- 利用谱划分加速有限马尔可夫链收敛,论文详述算法原理 — michaelchchoi · 2026-08-25
- 如何对非均匀间距数据进行 FFT 变换:技术教程 — kastnerkyle · 2026-08-25
- GPT-5.6 尝试解 3300 道数学难题,完成率约 10% — littmath · 2026-08-25
- UCLA 提出自推测解码 SSR,加速推理模型 — kastnerkyle · 2026-08-25
- 用强化学习训练模型画代码,生成可编辑的艺术 — kastnerkyle · 2026-08-25