无角色LLM群体靠环境痕迹演化技术,共享世界组合强于单件

SwarmWorld: Stigmergic technological evolution in societies of language-model agents

Subhadeep Pal, Fiona Y. Wang, Markus J. Buehler

cs.AI, cond-mat.mtrl-sci, cs.CL

2026-08-27

MIT用SwarmWorld让50–200个同质LLM无角色、无配方地造可执行装置。共享世界在组合韧性与发明数上压过独立搜索,最强单件仍常由孤立搜索拿到。

这篇在解决什么

多数多 Agent 系统靠对话、预置角色或中心工作流协作。那只能说明模型会说话、会分工,测不出「交互是否真的比同样算力的独立搜索更强」。更缺的是:造出来的东西能不能在发明者离开后,还在物理世界里干活。

SwarmWorld 把这个问题做成可证伪实验。MIT LAMM 的 Pal、Wang 和 Buehler 把一群一开始完全同质的 LLM 放进持久的物质世界:没有角色、没有配方目录、没有全局奖励。Agent 只看局部观察和私有记忆,提出装置架构和控制器;确定性模拟器决定能不能建、建完能不能用。

方法

世界是格子上的资源、加工站、扰动场。Agent 用 gpt-5.6-luna(温度 0.7)按固定节奏出结构化计划,模拟器按物质守恒、空间和权限逐条校验。造出来的装置带着可执行控制器,每个 tick 都在跑,后来者可以撞见、继承、改程序。

对照拆成四档。完整文化:共享世界、消息与记录、跨 Agent 程序继承、器物痕迹。无通信:去掉直接说话,留下共享装置和程序继承。无显式文化:再去掉跨 Agent fork,只剩物理 stigmergy,即通过改环境来协调、不必对话。独立搜索:N 个单人世界,按终点取 best-of-N,这是很硬的对照。

评测把发现和功能拆开。检查点冻结状态、撤走全部 Agent,复制成 8 套未见过的污染、干旱、风暴日程,只让物理和已安装程序继续跑。通过验证门的装置才叫 invention:测过材料、完整设计、装上程序、过性能阈值、行为上新。

结果

800 tick、N=50/100/200、每格 4 个配对种子。共享世界在持有韧性和组合韧性上几乎全面压过独立包络;N=200 时无显式文化的验证发明数平均多 6 件,发现前沿 AUC 配对增益 +0.069。发现速度并不单调:N=50 时完整文化还落后独立包络,N=100 才翻过来。

行为分化是后验聚出来的,不是提示词写的。N=200 时围着装置干活的比例,完整文化约 27%,无显式文化 20%,无通信 17%。完整文化下多 Agent 共同贡献的装置分别占 67%、76%、56%(N=50/100/200)。展示的 16 件技术峰值分数从 0.790 到 0.347,从几丁质交换格到潮汐板、菌丝修复膜,不是收敛到一个模板。

条件(N=100,tick 3200)组合韧性验证发明持有韧性最强单件
完整文化0.24745.75与无显式文化接近0.2380
无显式文化0.23657.000.0446未单列
独立搜索包络0.17942.750.03560.3488

文化有助于组合和继承,不保证每项指标都赢。约 95% 的首次采用来自物理观察,不是跟发明者聊天。随机拿掉一半 Agent,几乎所有装置仍连着至少一个幸存者;针对性拿掉高度数节点,损失大得多。架构还迁到火山材料世界 AshenRealm 和序列限定的 Protein Realms;后者单一种子试点装上 3 件蛋白–基质材料,最强 SELP47K 效用 0.729,条件之间不能做推断比较。

为什么重要

对做多 Agent 系统的人,这是一条比「会不会聊天」更硬的尺子:共享物理底盘本身就能积累技术,显式文化改的是组织方式和发展轨迹,不是万能加速器。独立并行搜索仍可能拿到纪录单件。若目标是产品组合和灾后还能用,交互有用;若目标是刷单项分数,加对话可能反而添协调成本。

局限与存疑

每条件只有 4 个世界种子,一种模型、一套提示。模拟器定义功能和材料,图里的装置肖像是机制可视化,不是造出来的真物件。Protein Realms 是单一种子、目录约束的可行性演示。持有评测测的是撤走 Agent 后的程序,网络敲除测的是图拓扑,不是运行中世界的物理恢复。gpt-5.6-luna 的权重固定,没有在线学习。

术语

原文与代码

社区讨论

相关论文

全部论文解读