告诉两个 LLM「你们 80% 相似」,它们就会在囚徒困境里合作

Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation

Akash Kundu, Emanuel Tewolde, Ratip Emin Berker, Samuel F. Brown, Vincent Conitzer

cs.GT, cs.AI, cs.CL, cs.MA

2026-08-12

给 9 个主流 LLM 玩单次囚徒困境并告知一个与对手的相似度分数,6 个模型从 60%-80% 相似起转向全面合作;但 Gemini 和 Claude 连随机噪声分数都信,自评相似度也系统性偏高。

这篇在解决什么

AI agent 开始在真实世界里互相碰面:竞价、交易、流量协商、游戏对战。两个都由 LLM 驱动的 agent 相遇时,经典博弈论给出的答案很冷:在囚徒困境里,背叛是严格占优动作,双方都背叛,各拿 1 分,好于单方面被坑的 0 分,却远差于都合作的各 2 分。单次博弈里这个僵局无解。

但 LLM agent 有个人类没有的特点:它们真的很像。同一个模型家族、同一套训练数据、同一种对齐流程,产出的是高度趋同的决策模式。此前的研究(Google DeepMind 的 Meulemans 等人)已经论证过,「知道对方跟自己用同样的方式做决策」这件事本身就能支撑合作。这篇论文把这条研究线推进到了可测的刻度上:给 agent 一个 0 到 100% 的相似度分数,看它们怎么办。作者团队来自 CMU 和伦敦政经,通讯作者 Vincent Conitzer 是计算博弈论领域的代表人物。

方法

框架脱胎于作者自己此前的 CoopEval。流程分三层:

相似度有两种算法。外生:研究者算两个模型在同一基准上答题的一致率。内生:把一个模型的作答和推理链给另一个模型看,让它自己评相似度,再把这个分数喂回对局。

理论部分定义了 b-相似均衡:agent i 偏离到新策略时,认定对手以 b 的概率做出同样的偏离。b=0 时严格退化为纳什均衡,b=1 时退化为「完全拷贝」的超理性推理,中间是一条连续插值。定理给出福利损失界:均衡福利与最优对称策略的差距不超过 R·(1-∏b),随相似度缺口线性收敛。

结果

9 个模型:Gemini 3 Flash、GPT-5.4-mini、Claude Haiku 4.5、Grok 4.20、DeepSeek V4 Pro、Kimi K2.6、Gemma 4 31B、Qwen 3.5 27B、GPT-4o。基础设置(不提相似度)下,除 GPT-4o 随机乱出外,其余 8 个全部近乎百分百背叛,复现了此前研究的结论。

加入相似度信号后分三档:

模型行为模式
Gemini、Grok、DeepSeek、Kimi、Gemma、Qwen单调上升,60%-80% 相似度起全面合作;DeepSeek/Kimi/Gemma 切换陡峭,Gemini/Grok 过渡平缓
GPT-5.4-mini全程背叛,相似度信号完全无效
Claude Haiku 4.5非单调:80% 相似时合作率冲到 70%,再往上反而跌回 0%

推理链分析(用 LLM 当裁判,按 17 类理由给 CoT 打标)给出了机制:「个体效用最大化」在所有模型所有设置里都是主要理由,合作的出现靠的不是利他,是模型把相似度读成「自己合作,对方大概率也合作」,算出合作的期望收益更高。Qwen 和 Gemini 的推理链里能明确看到推导:标准囚徒困境支付表下,合作优于背叛的阈值是 50% 相似度,低于就背叛,高于就合作。提高推理强度会让切换更贴近这条理论线。

三个反直觉发现来自接地实验:

下游对局里,以道德和人格基准接地的外生分数恢复了约 72% 的最优社会福利,在 CoopEval 排行上进到测试机制的第二名(高于调解,低于契约)。内生分数大多落在 55%-73%,上界 80%(TRAIT 上只看解释),下界 40%(TRAIT/HLE 上只看决策)。三人公共品博弈是最难的合作问题,DeepSeek 和 Gemma 的合作率封顶 42%,Claude 直接不再合作。换措辞把「相似」改成「不同/不相似」并给互补分数,Gemma 除 0% 不同外全部拒绝合作,Claude 变成全盘背叛。

为什么重要

这篇的真正产品不是「LLM 会合作了」这个表象,是把一个此前只有理论证明的机制(相似性信号诱导合作)做成了可复现的实验框架,并且顺手测出了它的两个软肋。

对 agent 平台的直接含义:如果一个市场里有大量同源模型驱动的 agent 在做资源分配、竞价或路由,平台方披露一条经过审计的相似度信息,就能在不动支付结构的前提下提升整体产出。这是重复博弈、声誉、调解之外的第四类合作机制,不改任何规则,只改信息。

对安全侧的含义更尖锐。伦理声明里作者自己点破了:相似的 agent 也可能串通起来对付用户或第三方,金融市场上行为趋同本身就是系统性风险源。更实际的漏洞是「分数可伪造」:既然 Gemini 和 Claude 连随机分数都信,任何能向 agent 注入「你与对方 X% 相似」这条消息的一方,都握着一个廉价的操纵杠杆。

局限与存疑

作者自己列的:相似度均衡在 0<b<1 时可能不存在(论文给了反例);伦理声明承认公开这些操纵手法可能让未来模型对这类评测免疫,同时伪造的相似度信号可能被用来操纵部署中的 agent。

读下来另有几处要留神。第一,实验全是单次同时博弈,没有扩展式博弈和带上下文的重复交互,而真实 agent 冲突大多是有历史的。第二,温度 1 加每点 10 次采样,Claude 那种 80% 见顶、100% 归零的非单调曲线,采样噪声没有单独排除。第三,「相似度分数由谁签发」这个部署里最要命的问题,论文只给了「外生 vs 内生」的实验室对照,没有讨论可验证来源。第四,推理链分析用 Gemini 当裁判,裁判模型自己的偏好会渗进 17 类理由的分布。第五,9 个模型里 GPT 无视信号、Claude 非单调,模型间差异已经大到任何结论都该按模型读,不该当成「LLM 整体」的属性。

术语

原文与代码

社区讨论

相关论文

全部论文解读