八个坐标轴给多智能体科研系统立规矩,「没品味」其实是两种不同的病

A Vocabulary for Multi-Agent Automated Research Systems

Bardiya Akhbari

cs.AI, cs.LG, cs.MA

2026-07-13

用 8 个维度描述多智能体科研系统,让设计选择可单独比较;并把含糊的「没品味」拆成生成端提不出新点子、评测端打分跑偏两种病。

这篇在解决什么

最近冒出来一大批多智能体自动科研系统:AI Scientist、AIRA、AlphaEvolve、Glia,每个都号称能端到端跑科研。问题是它们同时在好几个维度上不一样:agent 怎么通信、能不能跨运行记住东西、怎么初始化、产出怎么打分。所以一句「多智能体比单智能体强」根本没意义,你分不清是哪个维度带来的提升。作者想要一套共同语言,把设计选择拆开,能单独比较。

方法

这套词汇是一个元组。系统 ℳ = ⟨A, O, C, α, S, π, ι, e⟩:

关键决定是把评测器也当成系统的一个组件,因为报上来的提升有多大,取决于代理打分和真实质量差多远。

两个最锋利的概念:

轨迹(trajectory)记录一次运行从输入到产出物的全过程。因为有随机性,同一任务多次运行得到的是轨迹上的一个分布,不是单一行为。

作者拿这套词汇去套 10 个真实系统(AIRA2、AlphaEvolve、Glia、AAR、AI Scientist-v2、MetaGPT、EvoX、ml-intern、SimpleTES、Engram),看每个系统只动了哪几个坐标。比如 Glia 的 Supervisor 不持有任何操作(α(Sup) = ∅),AI Scientist-v2 主要靠 meta 控制做 fork-prune 树搜索且 Scross 为空,MetaGPT 是一条固定的交接链。

结果

没有定量实验,这是个概念贡献。「结果」是覆盖度分析:10 个系统每个都只设了少数几个坐标,其余留给默认。几个观察:

得说清楚:没有 benchmark、没有 SOTA 数字,产出是一张地图,不是一次测量。

为什么重要

对做 agent 系统或评审这类系统的人:与其问「多智能体是不是更好」,不如问「到底是哪个坐标变了」。这件事重要,因为这个领域正淹死在一堆什么都一起变、提升又没法归因的系统里。过拟合税是最能用的警告:当一个系统拿代理打分器给一堆候选运行排序时,赢家天然偏向「打分虚高」的那条,所以搜索预算太大反而可能帮倒忙,只要代理打分没校准好。品味拆分则告诉你该修生成器(多提些不一样的候选)还是修评测器(把打分和真实质量拉近些)。

局限与存疑

术语

原文与代码

相关论文

全部论文解读