论文提出多智能体研究系统的八维描述框架
Bardiya Akhbari · hf · 2026-07-28
一个给多智能体研究系统用的形式化词汇表
这篇工作提出了一套用于自动化研究系统的统一描述语言,目标是让由一个或多个智能体组成的系统更容易被比较、复现和设计。
它把系统拆成 8 个维度:
- 智能体是谁
- 系统里有哪些操作
- 谁可以调用这些操作
- 智能体如何通信
- 哪些状态会在跨运行中保留
- 下一步动作如何选择
- 一次运行如何开始
- 输出如何评估
作者把一次完整执行定义为一条 trajectory(轨迹):从输入任务到最终产物的全过程。
文章强调,这种表述能把很多原本模糊的设计问题变成可测试的选择,比如:
- 智能体什么时候该通信
- 什么时候该获得或失去某种能力
- 哪些信息应该跨运行保留
同时,论文也指出评估器本身就是系统的一部分,因为所谓“提升”很大程度取决于代理分数和真实质量之间有多接近。
作者还把“taste(品味)”拆成两种不同的失败:
- 生成品味:在看到评分前,系统提出新轨迹的速度
- 评估品味:代理分数和真实质量之间的偏差
最后,论文用近期的自动化研究系统做了实例化,说明这套词汇能覆盖结构差异很大的方案。
「研究」频道最新
- ripgrep 崩溃排查最终查出内核 TLB 竞态 — BenBajarin · 2026-07-28
- 课程学习可防止强化学习智能体靠随机碰运气 — ShawnHymel · 2026-07-28
- OpenAI 和 Anthropic 未来可能要和客户自己的数据闭环竞争 — bigdata · 2026-07-28
- SWE-rebench 扩展到 5 种语言,并加入本地 Qwen 模型 — Fabulous_Pollution10 · 2026-07-28
- 巴塞尔大学招聘 LLM 训练方向博士与博后 — PMinervini · 2026-07-28
- Rednet 可复用 Bittensor 大半机制,但去掉全局共识 — sull · 2026-07-28