Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents
Batu El, Jinhee Paeng, Fatih Dinc, Shiye Su, Mete Erdogan, Aneesh Pappu, Haotian Ye, Wanjia Zhao, Surya Ganguli, James Zou
cs.AI, cs.MA, cs.SI
2026-08-17
研究模拟逾万个AI智能体社群反复交流意见,发现群体走向可用统计力学式规则预测,准确率最高达86%。
多个AI agent(能自主决策、可以互相收发消息的语言模型实例)组队协作正变得常见,从科研助手小组到客服团队。这些agent互相交流意见时,群体结果并不总是变好:可能出现从众效应,也可能演变成对立阵营,还可能把每个agent自带的偏见放大。Stanford和UC Santa Barbara团队想知道,给定一群agent的初始意见和它们之间的通信网络,能否提前算出群体最终会走向一致、分裂,还是原地不动。
团队搭建了逾1万个由32个language-model agent组成的虚拟社群,每个agent被赋予一段persona(性格或立场设定文本),8轮循环收发消息、更新意见。任务分两类:客观题用MATH数据集的竞赛数学题改成二选一,agent的persona是「已解出过一道同类题」的专家设定;主观题用党派立场类表态(如「强制接种疫苗侵犯身体自主权」),agent的persona取自TWIN-2K-500,一个包含2000多个真实人物问卷画像的数据集。agent两两之间的关系分「友好」(concordant,倾向认同对方)或「敌对」(discordant,倾向反对对方),分布在四类通信网络(随机图、低秩图、方格、三角格)里。
核心方法借用了统计力学里的Ising model(描述磁性材料中相邻原子自旋如何互相影响、趋于同向排列的经典模型)。每个agent的意见被看成+1/-1的自旋,群体的「能量」由两部分组成:agent与邻居意见是否一致的社会压力项,和agent自身立场偏好的内在项。据此推导出下一轮agent持某个意见的概率,是关于邻居意见加权和的逻辑斯蒂函数,权重由三个耦合系数分开刻画:friendly连接的拉力、unfriendly连接的推力,以及「有连接」本身的效应。所有系数通过梯度下降拟合观测到的意见转变数据得到。
拟合后的模型预测单步意见转变时,balanced accuracy(对翻转/不翻转、+1/-1四类样本分别算准确率再平均,避免多数类掩盖效果的指标)达到75%-86%,把8轮走势整体滚动预测时降到61%-77%,四个模型(GPT-4o-mini、Gemma-3n-E4B、Qwen3.5-9B、Llama-3.1-8B)在两类任务上全部跑赢三条基线:只重复上一轮意见的Persistence基线、忽略社交只看agent自身倾向的Interaction-Free基线(接近50%随机水平),以及只看群体平均意见、不看具体网络结构的Mean-Field基线(55%-73%)。换到训练时没见过的图结构(低秩图、方格、三角格)上,单步准确率不降反升,达到85%-97.8%,说明拟合出的规律不依赖某一种网络拓扑。
客观题上,agent群体交流后普遍更接近正确答案:GPT-4o-mini的社群里最初答错、后来转对的比例(28%)明显高于最初答对又被带错的比例(11%),Qwen3.5-9B是27%对7%,Llama-3.1-8B是16%对5%。党派立场类问题上则出现系统性右倾:Gemma-3n-E4B社群持右倾立场的比例从75%涨到96%,Qwen3.5-9B从52%涨到67%,GPT-4o-mini从30%涨到37%,只有Llama-3.1-8B基本不变,约53%,略有下降。GPT-4o-mini的agent群体起点其实明显偏左,仅30%持右倾立场,交流后依然整体右移,起点立场和漂移方向是两回事。拟合出的系数显示,concordant连接的拉力(0.99-3.03)全面强于discordant连接的推力(不超过0.73,两种情形下甚至为负),这解释了群体为何容易走向consensus(一致)而非长期对峙;持正确答案的agent对邻居的拉力也比持错误答案的agent更强,是客观题准确率上升的机制来源。
这篇论文把「多智能体系统会不会跑偏」的问题,从只能靠事后跑一遍模拟观察,变成了一个可以提前用少量参数预测的问题。如果通信网络里concordant和discordant连接的比例、agent的初始意见分布是已知的,理论上可以在部署前估算出这个agent群体大概率走向一致意见还是分裂,以及是否会系统性放大某种偏见。对正在设计debate、mixture-of-agents、agent团队审稿这类多智能体协作系统的团队,这提供了一种不用把所有场景都实跑一遍的评估思路。
作者明确列出三条简化:群体在同一时间只回答一个共享的二选一问题,agent的输出被压缩成+1/-1外加一句简短消息;通信网络在整个过程中固定不变、且双向对称,不会随对话动态调整;agent每轮更新只依据自己的persona、题目和当前收到的消息,不记住更早轮次的完整交流历史。作者承认最大的局限是模型只用了消息立场的正负号,没有真正用上消息本身的自然语言内容。系统性右倾这个结果建立在四个中等规模模型上,并非当前最强的推理模型,四个里也只有三个观察到明显右倾,Llama-3.1-8B并不显著。作者也特别提醒,这些agent是被提示扮演persona的语言模型,实验测的是这套系统本身的动力学,能不能类比到真实人类群体的意见演化,仍是留给未来验证的假设。