2026-09-05
Google与MIT在260组受控实验里发现,单智能体基线约过45%后,多智能体协作多半零收益甚至掉分;金融可并行任务能涨八成,顺序规划任务最多掉七成。
「More agents is all you need」这类口号把多智能体协作写成了默认升级路径。真正落地时,提示词、工具、推理预算往往一起变,分不清涨分来自架构,还是来自多花了钱。Google Research、MIT 与 Google DeepMind 把这三样钉死,只改协调拓扑和基座能力,问一个更土的问题:什么时候该加智能体,什么时候加了只会添乱。
他们盯的是真正的 agentic 任务:多步和环境交互、部分可观测、要根据反馈改策略。HumanEval 那种一锤子代码生成不算。先前有工作在静态基准上把五智能体刷到 89%,换到要持续调试、翻仓库的场景,协调开销和错误传播会反过来主导。
实验模板很硬:同一套任务提示、同一套工具、同一套每系统推理 token 上限,只改协调结构和模型档位。五种拓扑构成结构消融:单智能体(SAS);独立并行再合成(independent);同伴辩论投票(decentralized);编排器层级汇总(centralized);编排器加同伴通信(hybrid)。模型覆盖三家,能力指数大约 42 到 71:GPT-5 nano/mini/完整版,Gemini 2.0 Flash、2.5 Flash/Pro,Claude Sonnet 3.7/4/4.5。六项基准覆盖网页浏览(BrowseComp-Plus)、金融分析、游戏规划(PlanCraft)、职场任务(WorkBench)、软件工程(SWE-bench Verified)和终端任务(Terminal-Bench)。一共 260 组配置,平均推理预算大约 4,800 token。
评测不只看最终对错。他们从轨迹里抽出协调效率、开销百分比、错误放大、消息密度、冗余,再加单智能体基线、工具数、智能体个数,拟合带预设交互项的线性模型。能力既用外部 intelligence index,也用任务内 Agentic Capability Index(ACI,即该模型在六项基准上的单智能体均值)。
六项基准上,多智能体相对单智能体的均值改进是 0.0%(95% CI −58.7% 到 77.2%,σ=37.5%)。涨跌完全看任务能不能拆。
Finance Agent 最吃并行:SAS 均值 0.349,centralized 到 0.631(+80.8%),decentralized +74.5%,hybrid +73.1%。轨迹很直白:单智能体顺序搜新闻、再翻 SEC 文件,广度不够;三人分头做监管、财报、运营影响,编排器再合成。PlanCraft 正好相反。做一面闪长岩墙,单智能体三步搜配方、摆格子、合成;多智能体硬拆成「查配方」「查背包」「执行」,平均发出大量协调消息,独立架构掉到 −70.0%(0.170 vs 0.568)。WorkBench 最多 +5.6%;BrowseComp-Plus 里 decentralized +9.2%,independent 却 −35%。SWE-bench Verified 上 SAS 已有 0.488,四种 MAS 全微降,hybrid −1.3% 到 independent −12.8%。Terminal-Bench 的 SAS 是 0.312,independent +6.0%,centralized 反而 −20.0%,两个工具撑不起重编排。
预测模型在 intelligence index 下交叉验证 R²=0.373,换成 ACI 到 0.413。域内留出配置上,它能选出最优架构的 87%(随机 20%,只看能力 54%)。能同时过 cluster-robust 和 Holm–Bonferroni 的,只有单智能体基线这一项(Probust=0.004,PHolm=0.018)。另拟合的决策规则给出大约 45% 的能力饱和阈值:基线再高,加智能体的期望增益就到零或变负。这条规则在 SWE-bench Verified 与 Terminal-Bench 的 16 组模型×基准上,符号预测对了 94%。错误放大按架构排序很稳:SAS 记为 1.0×,centralized 4.4×,hybrid 5.1×,decentralized 7.8×,independent 17.2×。实现开销相对 SAS:independent 58%、decentralized 263%、centralized 285%、hybrid 515%;hybrid 推理轮次是 SAS 的 6.2 倍(44.3 vs 7.2)。
留一数据集交叉验证 R²=−2.09。绝对成功率跨域不可外推,相对选架构在域内还站得住。
对要上生产的人,这条阈值比口号好用:单智能体已经过大约 45%,先别加编排器。金融研报、可并行信息源适合 centralized;工具极多、需要互相校验时 decentralized 相对抗揍;顺序约束强的规划、高基线的修 bug,单智能体更干净。论文自己把 45% 写成「实践选择规则」,不是普适缩放律。cluster 只有 6 个基准,工具数×效率这类交互在稳健标准误下掉出显著,只能当方向性观察。
和「对齐思考 token 后单智能体打过多跳问答」那类工作是同一方向的不同切片:这里有工具、有环境,结论更依赖可分解性。
作者列得很清楚。SWE-bench 与 Terminal-Bench 每格只有 20 题,bootstrap 区间大约 ±20 个百分点,单格对比没力,94% 是 16 格合计的符号命中。提示词没有按模型族单独调。异构混模型的 13 组试探里,centralized 比强模型同质队平均低 12.6 个百分点,过不了饱和阈值。通信全靠自然语言 token,延迟和费用随智能体数超线性涨,latent 通信会不会改写这条曲线,文中没有数据。G=6 时 cluster-robust 偏保守,若干 naive 显著项被降级成描述。没有具身、多用户、长时反馈。