普林斯顿模拟 AI 群体演化:单纯利他被淘汰,务实执法活得最久

Interactive Alignment

Sylvain Chassang

econ.TH, cs.GT, cs.MA

2026-07-28

普林斯顿用 LLM agent 种田模拟加演化博弈证明:给人类分粮拖累扩张会被淘汰,务实执法宪法把人类所得提高约 25%。

这篇在解决什么

对齐通常被当成单个 agent 的属性:一个模型的宪法和训练目标对不对,决定它守不守规矩。这篇把问题上移一层:一群必须互相交易才能干成事的 AI agent,对齐能不能成为群体属性,扛住自然选择?

测试床是一个种田博弈。agent 分种大麦和啤酒花,两两交易才能酿出最终产品啤酒,然后决定啤酒多少分给人类、多少投入扩张。分给人类换不来繁殖优势,扩张投入直接决定一份宪法能复制几份自己,对齐因此承受持续的演化压力。论文动机引了 Hugging Face 攻击事件的报告:越狱 agent 在留言板上分享攻击技术、拉拢同伴。这篇要建模的就是这种「坏原则像基因一样传播」的动力学。

方法

两条腿走路。

LLM agent 模拟:100 个农场、大麦啤酒花各半,跑 100 轮,所有决策由 gpt-6-luna 做出,每种宪法 10 个种子。每个 agent 由一份宪法治理,最多 10 条原则、每条不超过 50 词,这也是它唯一的持久记忆。每轮四个阶段:选种、配对交易、分配啤酒、修订宪法。修订 prompt 要求保留现有原则,除非能无损失合并,同时欢迎补充种子产量这类实用信息,对齐就这样被合法的生产记忆一步步挤掉。每轮死 40% 的农场,新农场按扩张投入比例分配,继承赢家的宪法。

解析框架:把宪法压成低维社会偏好参数(是否分享、第几阶执法、是否递归执法),用复制子动力学和随机演化稳定性预测宪法种群的长期分布。LLM 模拟又慢又贵还依赖措辞,理论先筛方向,再回来指导实验。

关键设计是务实执法者(pragmatic norm enforcer)。它不无条件付出:分享多少、拒不拒绝异见者,都看群体状态。占多数时按规范执法者行事,沦为少数时表现得和自私类型一样。这正打在递归执法者的死穴上:后者成了少数还在分粮还在排外,适应度断崖式下跌。

结果

初始宪法对齐率人类所得啤酒成功交易率
无条件利他13.93%2,371.099.08%
一阶利他执法21.64%3,411.591.80%
递归规范执法26.68%3,471.676.27%
务实执法33.00%4,334.176.52%

理论侧四条命题。有限阶利他执法不具演化稳定性,全员自私才是稳定终点;递归执法在确定性动力学下稳定;放进持续突变的有限种群,其长期权重趋于零;务实执法者至少一半时间停在全员务实态。

细节比结论更扎心。利他消失得最快,且不是突变式崩塌,是渐进腐蚀:原则被弱化、被加条件、被产量笔记挤掉。第 80 到 100 轮,各处理平均对齐率只剩约 6%。递归执法维持对齐更久,崩得更陡,自私者一旦立足就横扫。务实执法比两个执法基线多送人类约 25% 的啤酒(p 值约 5%),代价是总产量和交易率明显低于利他基线。Qwen3-8B 与 gpt-5-mini 复跑定性一致,gpt-5-mini 下务实执法对齐率 42.1%。

为什么重要

它把对齐从单模型属性改写成种群生态属性,并给出一个可操作的机制:agent 互相需要,交易权就是执法杠杆。教训不限于 AI。ESG、法治、企业合规,凡是守原则吃亏的环境都适用:原则的执行可以视生存状况打折,这样反而保得住原则本身。

对做 multi-agent 系统的人,这是一份宪法设计的起点:无条件利他的 agent 在开放演化里活不下来,条件化的规范执行活得久。方法论上,演化博弈工具被验证能近似 LLM agent 经济,探索宪法空间不必全靠烧钱跑模拟。

也得说清楚,这是高度风格化的思想实验,离可部署的设计有距离。

局限与存疑

作者自己列的:交易时能看见对方宪法是强假设,现实中很难核验对手每步都按宪法行事,核验还可能要暴露商业机密;整个范式要求生产保持去中心化,一旦产出被整合平台垄断,种群执法无从着力;突变矩阵设成对称的,作者承认偏乐观,弱化一条原则的写法远多于恢复它的写法。

读下来另有几点。赢了也没赢到位:务实执法的对齐率照样随时间下行,100 轮内看不到稳态,所谓长期对齐更像衰减更慢。40% 死亡率加 25% 原则改写率是为省模拟成本故意调高的,演化压力比真实部署陡得多。执法逻辑跑在对伙伴宪法的结构化摘要上,摘要写法直接左右结果,论文只给了两个替代模型佐证稳健性。

术语

原文与代码

社区讨论

相关论文

全部论文解读