260 组实测:多智能体最多涨 80.8%,也能跌 70%

Towards a Science of Scaling Agent Systems

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

cs.AI

2025-12-09

在 260 组配置上拟合出 agent 系统的 scaling 模型,交叉验证 R²=0.373,相对单智能体表现从 +80.8% 到 -70.0%,架构与任务的匹配决定成败。

这篇在解决什么

「多加几个 agent」在很多人眼里是提升 LLM 系统表现的默认手段,但什么时候多智能体真有用、什么时候反而拖后腿,过去没有定量答案。已有评测往往在不同架构之间混用了不同的 prompt、工具和算力,等于把架构本身的贡献和方法实现搅在一起。「更多 agent 就是答案」这类说法忽略了协调本身有成本。这篇要做的,是给 agent 系统建一套可预测的 scaling 模型,把架构选择从拍脑袋变成能算出来的东西。

方法

团队在 6 个 agentic benchmark 上铺了 260 组配置,覆盖 5 种典型架构:单智能体(SAS),以及独立(Independent)、集中式(Centralized)、去中心化(Decentralized)、混合(Hybrid)四种多智能体形态,横跨 OpenAI、Google、Anthropic 三个 LLM 家族。关键设计是把工具、prompt、算力统一,只让架构变量动,这样才能把架构效应单独拎出来。

他们用混合效应回归拟合这 260 组数据,模型有 20 个参数,分四类:基础模型能力(Intelligence Index I)、系统配置(agent 数)、任务属性(工具数、单智能体基线)、以及一组实测的协调指标(效率、开销比例、错误放大系数、消息密度、冗余度)。带二次项和交叉项,用来捕捉「能力越高,协调收益越小」这类非线性。

结果

回归模型交叉验证 R²=0.373,换上任务相关的能力指标(ACI)后到 0.413。在留出配置上选最优架构的命中率 87%。

相对单智能体基线,多智能体的表现从 +80.8% 到 -70.0% 不等,跨度极大:

benchmark最优多智能体变化最差多智能体变化
Finance-AgentCentralized+80.8%--
BrowseComp-PlusDecentralized+9.2%Independent-35%
PlanCraftHybrid-39.1%Independent-70.0%
SWE-bench VerifiedHybrid-2.1%Independent-14.9%

协调开销和错误放大同样悬殊:混合架构开销达 515%,独立架构错误放大 17.2 倍,集中式只有 4.4 倍。他们还拟合出一条能力饱和阈值,单智能体基线一旦超过约 0.45,继续加 agent 就开始亏。

三个规律:单智能体已经够强(基线 >45%)的任务上协调收益递减甚至转负;工具密集型任务上多智能体尤其吃亏,token 预算被切碎后不够编排复杂的工具调用;没有集中式核验的架构会把错误一路放大。

为什么重要

对从业者的直接价值是别无脑上多智能体。这篇把「多智能体有没有用」从一个信仰问题变成一个可以照着基线和任务结构估算的问题:任务可分解、单智能体还弱的场景(比如金融推理)上多智能体能拿到 +80%;而需要长链条规划、工具密集的场景,多智能体可能直接砍掉七成表现。R²=0.37 这个数字也老实,意味着模型能解释大约三分之一到四成的方差,够用来选架构,远不够精确预测绝对分数。

局限与存疑

作者自己列了几条:SWE-bench 和 Terminal-Bench 因为 Docker 评测太贵只用了各 20 条的子集;只挑了四种多智能体配置,不是穷举;Intelligence Index 和任务相关 ACI 指标相关性只有 r=0.45,能力量化还有很大改进空间。最要紧的是「agentic」的定义相对当下模型能力静态划的,模型变强后今天算 agentic 的任务明天可能就不算了。

术语

原文与代码

社区讨论

相关论文

全部论文解读