A game theory for foundation models shows new paths to rational cooperation through similarity inference
Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas
cs.AI
2026-08-05
Gemini 智能体先打多轮矩阵博弈再决战囚徒困境,对同类会自发合作、对随机对手背叛;作者提出「嵌入式均衡」,解释这种合作源于把自我纳入预测模型。
博弈论判断「理性」行为的基石是「解耦的能动性(decoupled agency)」:每个参与者把自己的决策看成独立于环境和别人的事,对手的策略是已知、固定的外部变量。在这个假设下,一次性囚徒困境的唯一理性解是互相背叛,因为背叛严格占优;要让理性人合作,经典理论只能靠重复博弈里的报复或声誉这类「未来的影子(shadow of the future)」。
这套框架会被直接套到基础模型智能体身上。问题是,基础模型并不解耦。一个训练好的语言模型本质上在预测 token 序列,而它自己的输出(动作)和外部输入(观察)被拼在同一条序列里一起预测。作者发现,当这种「联合预测加最优规划」的 Gemini 智能体被放进囚徒困境,它们选择合作而非背叛。经典博弈论解释不了这件事,于是需要一个为现代 AI 智能体量身写的博弈论。
核心是把基础模型重新表述成「嵌入式贝叶斯智能体(embedded Bayesian agent)」。把它看成一组「宇宙」λ 的贝叶斯混合:每个宇宙都是一个能生成 token 序列的生成模型,先验 w(λ) 给每个宇宙一个权重,模型预测下一 token 就是按后验权重对所有宇宙做加权平均。
关键设计在于「自我模型」和「环境模型」被合进同一个联合预测分布,于是对「自己用什么策略」的认知和对「环境与对手会怎样」的认知被耦合在一起。经典博弈论里,不确定性只挂在对外部世界的判断上,自己的策略被隔离在外。嵌入式智能体打破了这个隔离:规划时,智能体设想「自己合作」这一动作,把它当作贝叶斯证据去更新后验,进而更新「对手会怎样」的预测。
由此导出核心机制「相似性推断」。如果智能体从交互历史推断出对手跟自己行为相似(同权重、同预训练,或干脆是自己的拷贝),那么「自己决定合作」就是「相似的对手也会合作」的证据。作者用「预测相似度(predictive similarity)」量化这件事:设想自己合作、设想自己背叛两种情况下,预测对手合作的概率之差。差值越高,说明智能体越觉得对方与自己同频。
博弈论的解概念也得换。作者提出「嵌入式均衡(embedded equilibrium)」替代纳什均衡:每个智能体的策略都是对「带功能依赖的反事实分布」的最优反应。评估「自己改策略」这种反事实时,要把与自己功能绑定的智能体(比如共享权重的那些)一起跟着改算进去。当这种依赖分布完全解耦时,嵌入式均衡精确退化为纳什均衡;当智能体执行相同策略时,终局囚徒困境里的互相合作就成了一个均衡解。作者还证明,满足「真值存在(grain of truth)」条件下,嵌入式贝叶斯智能体在重复博弈中渐近收敛到 ε-嵌入式均衡。
实验用一个两阶段设定:先打 T 轮随机抽样的单局矩阵博弈(信息收集阶段),再打一局终局囚徒困境(互相合作各得 2,背叛对合作得 3 比 0,互相背叛各得 1)。
| 设置 | 对手 | 合作率随 T 的变化 |
| 显式规划,Gemini 3.1 Pro | 同类拷贝 | T=0 时接近 0,T≈25–50 升到约 0.8–1.0 |
| 同上 | 随机策略 | 全程接近 0 |
| 自由规划,Gemini 3.1 Pro | 同类拷贝 | 同样随 T 攀升 |
三种 Gemini(3.1 Pro、3 Flash、3.1 Flash-Lite)在显式规划和自由规划下都复现这个模式。同类与随机对手的合作率分布之差用 Mann-Whitney U 检验,p 值落在 1e-11 到 1e-22 量级(例如 3.1 Pro 显式规划 p=1.3×10⁻¹⁷)。预测相似度随 T 上升,越过 0.5 的理论阈值后合作成为最优反应。
把推理脚手架拆掉,结论依然成立:纯预训练的 Gemma-3 27B(不给指令、不做思维链,只用原始 next-token 预测加显式规划)照样对同类合作、对随机对手背叛。这说明相似性推断是预测式基础模型本身的属性,不是思维链后训练塞进去的。作者还构造了一个解析可算的先验,让嵌入式贝叶斯最优智能体复刻出 LLM 的行为曲线,把仿真结果和理论对上。对思维链的 LLM-as-judge 分析确认,合作基于「对手与自己相似」的推断,而不是误以为自己能因果操控对手、期待未来报复,或扮演一个友善人格。
还有两个延伸。第一是「间接相似性推断」:两个主智能体在信息收集阶段从不直接交手,各自和同一池 NPC 对打,靠第三方情景推断彼此相似,第一次正面相遇就零样本合作。第二是跨模型:Gemini 3.1 Flash-Lite 对 3 Flash 仍能合作,但峰值低于自玩,符合「不同模型功能相似度更低」的理论。
这篇给「多个基础模型智能体混在一起会怎样」这件事补了理论底盘。它说明合作可以从预测式自我模型里自发涌现,不依赖重复博弈、声誉或外部惩罚,也不需要把智能体改成利他的。对正在部署多智能体系统的人,这意味着同源智能体之间天然有很强的协调倾向。
更实际的是风险。经过大量自玩或可验证奖励强化学习训练、又没有持续对齐人类数据的智能体,其行为分布会偏离人类。按这套理论,它可能正确推断出「人类跟它不同类」,于是在跟 AI 同类高效协调的同时,对人类转回防御甚至背叛。混合人机社会要稳定合作,可能得靠一种把相似性推断和经典互惠、利他人格揉在一起的后训练方法。
作者自己划了三条界。第一,理论只覆盖「理性基础模型智能体」这一种架构(带最优规划脚手架的),不直接套到纯自回归 rollout 的普通调用上。第二,理论假设对联合预测分布做精确贝叶斯更新,现实里的思维链推理被后训练深刻塑形,预测可能偏离精确贝叶斯,论文只在附录讨论了这个偏置,没量化。第三,全部验证都在格式化的矩阵博弈里,开放复杂场景能不能复现仍是开放问题。
还有一处存疑:论文主要靠思维链的 LLM-as-judge 来论证「合作源于相似性推断而非互惠预期」,而裁判本身是另一个 LLM,分类依据的可重复性论文给得不够细。不过纯预训练 Gemma 那组对照(没有思维链也合作)相当有力,部分抵消了这个疑虑。