Sakana 与 MIT 用 CLIP 自动搜索人工生命,找到开放性超 Conway 的规则

Automating the Search for Artificial Life with Foundation Models

Akarsh Kumar, Chris Lu, Louis Kirsch, Yujin Tang, Kenneth O. Stanley, Phillip Isola, David Ha

cs.AI, cs.NE

2024-12-24

ASAL 用 CLIP 给仿真画面打分,把找人工生命变成自动搜索,在 Lenia、Boids 等五种基底上发现新生命形态,以及开放性超过 Conway 生命游戏的规则。

这篇在解决什么

人工生命(Artificial Life,ALife)研究的不只是地球上的生命,还有「生命本可以是什么」。手段是仿真:Lenia、Boids、元胞自动机这类系统里,简单规则反复迭代,涌现出类似细胞、鸟群的结构。这个领域卡了几十年的问题恰恰在规则本身,复杂系统的行为无法从配置预先推出,研究者只能凭直觉和试错手工调出「感觉对了」的世界,意外发现的空间被压得很小。

自动搜索早有人尝试,难点在打分器:要搜「像生命的仿真」,先得有个东西能判断什么叫像生命。科尔莫戈洛夫复杂度、assembly theory 这些度量要么不可计算,要么抓不住人的直觉。这篇的切入点是,在海量自然数据上预训练的视觉-语言模型表示空间与人类相似,可以直接拿来当裁判。

方法

ASAL 把一类仿真基底(substrate)参数化为 θ,涵盖初始状态分布、状态更新函数、渲染函数。跑 T 步、渲染成图像、经 CLIP 编码,整条管线就变成可优化的目标。三种搜索模式共用这套管线:

优化器随基底切换:Lenia、Boids、Particle Life 用 Sep-CMA-ES(黑盒进化策略);NCA 的更新规则是神经网络,直接反向传播加 Adam;Life-like 元胞自动机只有 2^18 = 262,144 条规则,干脆全量暴力枚举。核心设计是把「有趣」的判断整体外包给 FM 表示空间,用预训练模型替代手工复杂度指标,这也是「人类对齐度量」说法的来源。

结果

发现具体内容
目标搜索Lenia、Boids、Particle Life 上,「一条毛毛虫」「自我复制的图案」等 prompt 均搜出匹配仿真;NCA 上「一个细胞→两个细胞」的时序目标搜出的更新规则本身具备自我复制能力,换初始状态仍成立
开放性搜索262,144 条 Life-like 规则全量评分,Conway 生命游戏排进前 5%;多条规则(如 B0136/S034678)的 CLIP 轨迹发散程度超过 Conway
基底照亮Lenia 图集出现大量此前未见、形似显微镜下细胞与细菌的生命形态;Boids 重新发现鸟群,另搜出蛇行、环绕、聚团等变体
定量分析Particle Life 中「毛毛虫」需粒子数 ≥1,000 才涌现;逐个扰动参数可排序重要性,绿-黄粒子相互作用强度对毛毛虫最关键;CLIP 向量随时间的变化率在 Lenia 静止时同步平台化,可当自动停机条件

消融上,把 CLIP 换成 DINOv2,照亮效果略降;换成像素表示则明显掉队,说明深层表示对人类认可的多样性很关键。

为什么重要

这篇把「设计世界规则」翻成了「描述想要的现象」,研究者给一句 prompt,搜索负责剩下的事。产出分两层:新生命形态这类以前靠运气的发现,以及一套把定性现象定量的工具,涌现阈值、参数敏感性、仿真停机都变成可算的曲线。管线对 FM 和基底都不可知,后续换更强的模型即插即用。

也要说清,这是范式开局之作,CMA-ES、遗传算法、暴力枚举全是现成件,新意集中在「用 FM 表示空间当搜索目标」这一步,单点技术深度有限。

局限与存疑

论文自己承认的:开放性搜索只覆盖 Life-like CA,Lenia 和 Boids 的预实验显示新颖度难以持续,NCA 被怀疑表达力过强反而搜不出有意义的结构;监督目标的失败大多归于基底表达力不足。开放性到底能不能量化这个根本争议也还在,论文只是把主观性转移到了表示函数的选择上。

另有几处没验证:「人类对齐」的依据是 CLIP 表示与人类相似的既有文献,论文内没有人类评估实验;「新生命形态」基本靠看图认定,没有外部基准;CLIP 对颜色、纹理的偏好会直接进开放性排名,换一个 FM 排名是否稳定,只给了 CLIP 与 DINOv2 的粗略对照。

术语

原文与代码

社区讨论

相关论文

全部论文解读