2026-07-28
这篇 Nature Machine Intelligence 把任务、工具、算力预算全锁死,只变协调结构和模型能力,跑了 260 组配置。结果多 agent 平均比单 agent 高 0.0%,涨跌全看任务可不可拆。
agent 到底要不要拆成多个,业界一直在吵。一边是「more agents is all you need」这种乐观口号,以及多 agent 在复杂任务上赢单 agent 的零星演示;另一边是越来越多发现「强单 agent 一样能打甚至更强」。难下结论,是因为过去的评测把架构、prompt、工具、算力预算搅在一起,没法干净归因到「协调方式」本身。
这篇(Nature Machine Intelligence,作者横跨 Google、MIT、DeepMind)做了一次受控实验:把任务 prompt、工具、算力预算全部锁死,只变协调结构和模型能力。
实验跑了 260 组配置,覆盖六类 agent 基准(BrowseComp-Plus、Finance Agent、PlanCraft、WorkBench、SWE-bench Verified、Terminal-Bench)、五种架构(单 agent 加四种多 agent:独立、中心化、去中心化、混合)、三个 LLM 家族(OpenAI、Google、Anthropic,各取多个能力档)。所有系统的算力天花板对齐,不让多 agent 白嫖额外算力。
他们用一组实测的协调指标(效率、错误放大、消息密度、冗余等)和预设的交互项,拟合一个线性回归,再用统计学方法(聚类稳健推断、Holm-Bonferroni 多重比较校正)筛出真正扛得住的因子。
把六个基准、所有架构摊平看,多 agent 相对单 agent 的平均改进是 0.0%(95% 置信区间从 −58.7% 到 +77.2%,标准差 37.5%)。极差很大:从 PlanCraft 独立架构的 −70.0%,到 Finance Agent 中心化的 +80.8%。
| 基准 | 多 agent 表现(相对单 agent) |
| Finance Agent | 中心化 +80.8%、去中心化 +74.5%、混合 +73.1% |
| PlanCraft | 独立 −70.0%、中心化 −50.3% |
| SWE-bench Verified | 全线微跌 −1.3% 到 −12.8% |
| WorkBench | 去中心化 +5.6%,其余基本持平或微跌 |
真正扛住统计的结论有两条。第一,单 agent 基线是最稳的预测因子:基线准确率高于约 45% 的任务,加 agent 多半不涨甚至跌,这条「能力饱和阈值」在 SWE-bench Verified 和 Terminal-Bench 的验证集上 94% 的配置里预测对了涨跌方向。第二是「基线尺度的错误放大」:没有中心化校验的架构会随任务变难放大错误,独立架构放大 17.2 倍、中心化只有 4.4 倍。拟合模型域内交叉验证 R²=0.373(换成任务接地的能力度量到 0.413),在 87% 的留出配置里选对了最优架构。
这篇给的不是「多 agent 没用」,而是一条可操作的选择规则:任务能不能天然拆成并行子任务,才决定多 agent 值不值。金融分析这种收入/成本/市场因子可并行的,多 agent 大涨;像 PlanCraft 这种严格顺序依赖的(做墙得先查配方再拿材料再合成),拆开只会凭空多出一堆协调消息,烧 token。对正纠结要不要给系统上多 agent 的人,这篇等于一张「先看任务可拆性」的决策表。
作者自己讲清了几道边界。基准只有六个聚类,聚类数少时聚类稳健标准误偏保守,一些在普通 OLS 下显著的因子过不了校正;留一域交叉验证的 R² 是负的(−2.09),说明在没见过的领域上预测绝对成功率不行,那个 87% 的选架构准确率只在「域内插值」成立。混合不同模型搞异构团队,13 组试探里没看到能绕过能力饱和阈值。
更根本的:实验只覆盖当前 token 文本式的协调范式,作者指出多 agent 的经济性瓶颈正在于「协调得把推理序列化成自然语言」,如果未来换成潜空间推理或直接激活共享,这套规律会变。所以 45% 这个阈值是经验选择规则,不是普适的标度律。