Automating the Search for Artificial Life with Foundation Models
Akarsh Kumar, Chris Lu, Louis Kirsch, Yujin Tang, Kenneth O. Stanley, Phillip Isola, David Ha
cs.AI, cs.NE
2024-12-24
ASAL 用 CLIP 给仿真画面打分,把找人工生命变成自动搜索,在 Lenia、Boids 等五种基底上发现新生命形态,以及开放性超过 Conway 生命游戏的规则。
人工生命(Artificial Life,ALife)研究的不只是地球上的生命,还有「生命本可以是什么」。手段是仿真:Lenia、Boids、元胞自动机这类系统里,简单规则反复迭代,涌现出类似细胞、鸟群的结构。这个领域卡了几十年的问题恰恰在规则本身,复杂系统的行为无法从配置预先推出,研究者只能凭直觉和试错手工调出「感觉对了」的世界,意外发现的空间被压得很小。
自动搜索早有人尝试,难点在打分器:要搜「像生命的仿真」,先得有个东西能判断什么叫像生命。科尔莫戈洛夫复杂度、assembly theory 这些度量要么不可计算,要么抓不住人的直觉。这篇的切入点是,在海量自然数据上预训练的视觉-语言模型表示空间与人类相似,可以直接拿来当裁判。
ASAL 把一类仿真基底(substrate)参数化为 θ,涵盖初始状态分布、状态更新函数、渲染函数。跑 T 步、渲染成图像、经 CLIP 编码,整条管线就变成可优化的目标。三种搜索模式共用这套管线:
优化器随基底切换:Lenia、Boids、Particle Life 用 Sep-CMA-ES(黑盒进化策略);NCA 的更新规则是神经网络,直接反向传播加 Adam;Life-like 元胞自动机只有 2^18 = 262,144 条规则,干脆全量暴力枚举。核心设计是把「有趣」的判断整体外包给 FM 表示空间,用预训练模型替代手工复杂度指标,这也是「人类对齐度量」说法的来源。
| 发现 | 具体内容 |
| 目标搜索 | Lenia、Boids、Particle Life 上,「一条毛毛虫」「自我复制的图案」等 prompt 均搜出匹配仿真;NCA 上「一个细胞→两个细胞」的时序目标搜出的更新规则本身具备自我复制能力,换初始状态仍成立 |
| 开放性搜索 | 262,144 条 Life-like 规则全量评分,Conway 生命游戏排进前 5%;多条规则(如 B0136/S034678)的 CLIP 轨迹发散程度超过 Conway |
| 基底照亮 | Lenia 图集出现大量此前未见、形似显微镜下细胞与细菌的生命形态;Boids 重新发现鸟群,另搜出蛇行、环绕、聚团等变体 |
| 定量分析 | Particle Life 中「毛毛虫」需粒子数 ≥1,000 才涌现;逐个扰动参数可排序重要性,绿-黄粒子相互作用强度对毛毛虫最关键;CLIP 向量随时间的变化率在 Lenia 静止时同步平台化,可当自动停机条件 |
消融上,把 CLIP 换成 DINOv2,照亮效果略降;换成像素表示则明显掉队,说明深层表示对人类认可的多样性很关键。
这篇把「设计世界规则」翻成了「描述想要的现象」,研究者给一句 prompt,搜索负责剩下的事。产出分两层:新生命形态这类以前靠运气的发现,以及一套把定性现象定量的工具,涌现阈值、参数敏感性、仿真停机都变成可算的曲线。管线对 FM 和基底都不可知,后续换更强的模型即插即用。
也要说清,这是范式开局之作,CMA-ES、遗传算法、暴力枚举全是现成件,新意集中在「用 FM 表示空间当搜索目标」这一步,单点技术深度有限。
论文自己承认的:开放性搜索只覆盖 Life-like CA,Lenia 和 Boids 的预实验显示新颖度难以持续,NCA 被怀疑表达力过强反而搜不出有意义的结构;监督目标的失败大多归于基底表达力不足。开放性到底能不能量化这个根本争议也还在,论文只是把主观性转移到了表示函数的选择上。
另有几处没验证:「人类对齐」的依据是 CLIP 表示与人类相似的既有文献,论文内没有人类评估实验;「新生命形态」基本靠看图认定,没有外部基准;CLIP 对颜色、纹理的偏好会直接进开放性排名,换一个 FM 排名是否稳定,只给了 CLIP 与 DINOv2 的粗略对照。