八个坐标轴给多智能体科研系统立规矩,「没品味」其实是两种不同的病
A Vocabulary for Multi-Agent Automated Research Systems
Bardiya Akhbari
cs.AI, cs.LG, cs.MA
2026-07-13
用 8 个维度描述多智能体科研系统,让设计选择可单独比较;并把含糊的「没品味」拆成生成端提不出新点子、评测端打分跑偏两种病。
这篇在解决什么
最近冒出来一大批多智能体自动科研系统:AI Scientist、AIRA、AlphaEvolve、Glia,每个都号称能端到端跑科研。问题是它们同时在好几个维度上不一样:agent 怎么通信、能不能跨运行记住东西、怎么初始化、产出怎么打分。所以一句「多智能体比单智能体强」根本没意义,你分不清是哪个维度带来的提升。作者想要一套共同语言,把设计选择拆开,能单独比较。
方法
这套词汇是一个元组。系统 ℳ = ⟨A, O, C, α, S, π, ι, e⟩:
- A(agent):每个 agent 记录骨干模型、私有记忆、初始记忆、角色。
- O(操作全集):能调用的工具、技能、API、shell,即「能做什么」。
- C(通信):谁能给谁发消息(Λ)+ 消息的格式(σ)。
- α(能力分配):哪个 agent 能调哪些操作,把「系统里有什么」和「谁能用」分开。
- S(共享状态):运行内的草稿板(Sbtw)、外部世界状态(Sworld)、跨运行状态如技能库或种群库(Scross)。
- π(控制):路由(谁下一步)、停止、meta 控制(运行中途 spawn/kill、fork/join、grant/revoke)、探索 η。
- ι(初始化):起始记忆、状态、能力。
- e(评测器):代理打分器,带防 reward hacking 的完整性保护。
关键决定是把评测器也当成系统的一个组件,因为报上来的提升有多大,取决于代理打分和真实质量差多远。
两个最锋利的概念:
- 过拟合税(overfitting tax):一个系统给候选轨迹排序排得越多,排第一的那条越可能是「打分虚高」的。排序本身就是过拟合的来源。
- 品味拆分:「这系统没品味」太含糊。拆成生成端品味(还没打分前能不能提出新轨迹)和评测端品味(打分和真实质量差多远)。两种病,两种治法。
轨迹(trajectory)记录一次运行从输入到产出物的全过程。因为有随机性,同一任务多次运行得到的是轨迹上的一个分布,不是单一行为。
作者拿这套词汇去套 10 个真实系统(AIRA2、AlphaEvolve、Glia、AAR、AI Scientist-v2、MetaGPT、EvoX、ml-intern、SimpleTES、Engram),看每个系统只动了哪几个坐标。比如 Glia 的 Supervisor 不持有任何操作(α(Sup) = ∅),AI Scientist-v2 主要靠 meta 控制做 fork-prune 树搜索且 Scross 为空,MetaGPT 是一条固定的交接链。
结果
没有定量实验,这是个概念贡献。「结果」是覆盖度分析:10 个系统每个都只设了少数几个坐标,其余留给默认。几个观察:
- 没有一个系统在运行中改过能力分配 α(卡在权限基础设施的工程成本上)。
- η(探索/随机性)在每个系统里都停在默认值。
- 架构和任务对不对得上,比 agent 数量 |A| 更能预测收益。加 agent 不是杠杆,把结构和任务配对才是。
得说清楚:没有 benchmark、没有 SOTA 数字,产出是一张地图,不是一次测量。
为什么重要
对做 agent 系统或评审这类系统的人:与其问「多智能体是不是更好」,不如问「到底是哪个坐标变了」。这件事重要,因为这个领域正淹死在一堆什么都一起变、提升又没法归因的系统里。过拟合税是最能用的警告:当一个系统拿代理打分器给一堆候选运行排序时,赢家天然偏向「打分虚高」的那条,所以搜索预算太大反而可能帮倒忙,只要代理打分没校准好。品味拆分则告诉你该修生成器(多提些不一样的候选)还是修评测器(把打分和真实质量拉近些)。
局限与存疑
- 作者自己承认:好几个坐标没人动过(运行中改 α、η 老是默认、任务分布固定),所以词汇在这些地方的区分力根本没被检验过。
- 生成端品味还停留在定性:没有衡量「新颖度」的指标能给生成器单独打分。
- 真实质量 q 一般不可计算,只能朝它设计、没法直接测,所以评测端品味永远只能近似、不能直接量化。
- 再说一层:作为一篇立场的论文,它成不成取决于有没有人采用。这 8 个坐标会不会变成共同语言,还是被别的框架取代,目前没答案。单人署名、没有实验,意味着它是个提案,不是一次验证。
术语
- trajectory(轨迹):一次运行从输入任务到产出物的完整记录。
- Scross(跨运行状态):跨多次运行留存的东西,如技能库、进化算法的种群库;设成空表示系统每次从零开始。
- capability assignment α(能力分配):哪个 agent 能调哪些操作,把「有什么操作」和「谁能用」分开。
- meta-control πmeta:运行中途改系统结构,如 spawn/kill agent、fork/join、grant/revoke 能力。
- overfitting tax(过拟合税):评测器给候选排序时,排第一的越可能是打分虚高的那条。
- generative taste / evaluative taste:生成端品味是打分前能不能提新轨迹,评测端品味是打分和真实质量差多远。
原文与代码
相关论文
全部论文解读