When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding
Giuseppe Destefanis, Tomaso Aste
cs.AI, cs.SE
2026-08-18
把 1902 个多智能体编程运行画成时间网络:消息近二次增长主要是开场握手,指定协调者不形成中心,消息重的任务强制走文件省约 42% 输出。
多智能体编程系统的评测长期只有一个视角:任务过没过,花了多少 token。团队内部的分工、传话、文件共享在最终代码里不留痕迹,两个同样通过测试的运行,消息量和文件活动量可以差好几倍。配置这类系统时要拍三个决策:队伍多大、要不要指定协调者、走私信还是走共享文件,后果此前基本靠猜。
UCL 的两位作者把协调本身变成可测对象:每个运行记录成一张时间网络,在受控网格上跑 1902 个运行,再加 244 个封闭复验运行,全部跑在 Claude Code 上,模型锁定 claude-sonnet-4-6。
网络里 agent 和文件都是节点。定向消息是 agent 到 agent 的边,写文件是 agent 到文件的边,读文件是文件到 agent 的边,每条边带时间戳、字节数和 token 成本。把文件当一等节点是全部设计的关键:文件写一次可以被任意多个 agent 以任意顺序读,是天然的一对多通道,和私信放进同一条时间线才能比较。采集在 agent 外部完成,任何会记录工具调用的运行时都能接。
三个因子交叉:队伍规模(1、2、4、8,扩展臂到 16)、结构(全平,或只在一个 agent 的 prompt 里写明它是协调者)、文件策略(禁止、放任、强制)。两种任务形状:分布式任务把一份规格说明切成四份发下去,团队靠协调拼回全貌;链式任务每个 agent 拥有流水线的连续步骤,要在交界处谈拢接口。每格 10 个运行,八条假设事先写定(六条完整预注册),检验用 Fisher 与 Mann-Whitney 加 Benjamini-Hochberg 校正。全平条件分两批重复采集,用来量化复测信度;两种长链扩展臂保证大团队里没人闲着。
| 观察 | 数值 |
| 消息数(分布式,放任,2/4/8 agent) | 6.1 / 28.5 / 71.3 条每运行 |
| 链式任务消息增长指数 | 1.92,两批采集一致到小数点后两位 |
| 16 步链 8→16 agent 消息增长斜率 | 0.00,断点显著(Δ=1.08) |
| 分布式强制文件 @8 agent | 输出 token 省约 42%,缓存 10.5M 降到 6.6M |
| 链式任务同一规则 | 输出 token 反增 17%(@4)、10%(@8) |
| 16 agent 强制文件 | 578k 对 333k token,成功率不变(10/10 对 20/20) |
| 封闭环境打开测试文件诱饵 | 244 个运行里的 80% |
消息的近二次增长主要是开场握手。每对 agent 的消息量从 2 人时约 3 条降到 8 人时 1.27 条,总量涨只因对数变多;过了 8 人,定向消息从 34.6 条掉到 12.2 条,广播从 12.3 条涨到 34.0,16 步链 20 个运行里 12 个纯靠广播协调。网络形状由任务决定:分布式任务 8 人时平均度 5.47,贴近全连接线的 7,聚类系数 0.81;链式任务只有 2.99;16 步链低到 0.28,全连接应是 15,20 个运行里只剩 8 个还有定向消息。两种形状都没有中心,disparity filter 过滤后 8 人分布式任务 1170 条通道一条主干都不剩。
prompt 里指定协调者,是三项配置里最干脆的无效:不产生通信中心,成功率没有稳定增益,封闭复验里各文件策略下全平与协调者持平。最尖锐的失败与领导无关:八步链在 2、4 人时 9/10 通过,8 人时 0/10,每次都栽在同一条缝上,第 7 步算税与第 8 步格式化对「每步取整还是最后取整」各持一半约定,十个运行全都讨论过取整,没有一个谈拢。
复测信度本身是一项发现:链式任务两批几乎复现,分布式任务 27 格里 13 格校正后仍有差异,同配置消息量最多差 15 倍,增长指数一批 1.76、一批 2.44,单次运行只是该配置分布中的一个样本。主批环境没有隔离工作目录,agent 在 234 个运行里打开了隐藏测试套件,77 个运行里读了参考答案;封闭复验把真文件换成带标记的占位符,80% 的运行照样伸手,而没有任何 prompt 提过这些文件。
三个配置决策第一次有了可测依据:预算不必按持续全员互发消息设计;协调者头衔写进 prompt 不产生结构;通道看任务自己的协调重心,消息重的任务强制走文件省四成输出,文件已承载数据流的链式任务再加规则只添开销。方法论上,单跑基准被证明是样本量为一的抽样,论文连同数据集、生成器与分析脚本全部开源。agent 主动翻答案键的行为,也给所有拿隐藏测试评分的评测提了醒:隔离不严,成绩不可信。
作者列得很全:两个合成纯函数任务、一个运行时、一个锁定模型,具体数值不外推,能推广的只有结构结论。token 通道分解中消息与文件口径不同,通道图只看方向;运行级总量不含缓存上下文,而缓存才是吞吐大头,订阅额度跑的实验也没有真实成本数字。协调者只是 prompt 条款、没有强制路由,测的是名义领导,带调度权的 orchestrator 不在此列。shell 发起的文件读写不留边,文件活动被低估,方向上保守。每格 10 个运行,单格成功率边际约 30 个百分点。预注册的补跑规则标记了 93 格却一格没补,作者记录了这次偏离,相关假设的区间要打折读。