AI agents reshape consensus formation in human groups
Lin Chen, Ziyi Liu, Xia Hu, Yong Li
cs.CL, cs.CY, cs.SI
2026-09-02
清华用 24 人七巧板描述博弈、127 名被试,把 Qwen2.5-VL 比例从 0 调到 75%。12.5% 时共识升 8.0%,33.3% 时降 23.1%;75% 时强度回到 0.725,内容从「兔子在坐」变成「三角形」。
LLM agent 已经进工作群和协作平台,不只是工具,是对话对手。纯人类群体会自发形成惯例,纯 agent 群体也会。真实部署落在中间:人和模型反复配对、共同改说法。已有研究多看 AI 对既定任务分数的影响,很少看群体自己长出来的规范归谁、长成什么样。
这篇用指称交流范式的协作描述博弈,把 agent 比例当成实验变量,问三件事:混合群体能不能收敛、收敛由谁主导、最终说法还像不像人话。
每组 24 个位置,随机配对,各自用英文描述同一张抽象七巧板,提交后看到对方描述和相似度分数,重复 40 轮。不给词表。Agent 比例 0% / 12.5% / 33.3% / 50% / 75%。主模型 Qwen2.5-VL-32B-Instruct。清华 IRB,127 名中国高校被试,筛选过英语描写能力。12.5% 时一组里只有 3 个 agent;75% 时一组只剩 6 个真人。
共识强度:用 all-MiniLM-L6-v2 嵌描述,对全体 pairwise 余弦相似度做个体中心化后取终轮均值。纯人类基线 0.695。方向性:看每个人终轮相对对方群体第 1 轮质心挪了多少。贡献拆两层:词表层(稳定词的早期扩散归谁)和概念层(场景图聚类后的语义地盘归谁),两者之比是 CLR。内容用具体度词典、命题密度,以及另一个 LLM 打的类比、整体、事件框比例。机制上再拆 adoption(靠近对方)和 persistence(守住自己),并在 33.3% 上用提示词把 agent 拧成高采纳或高固执,另换 Qwen2.5-VL-7B 做弱模型对照。会后问卷让被试判断对方是人还是 AI,并打采纳意愿。
比例和共识强度不是单调的,分成三档:
| 条件 | 共识强度变化 | 谁在挪 |
| 12.5%(H1) | 相对纯人类 +8.0%(z=3.282, p=0.001) | agent 更向人靠(0.822 vs 0.575,agent 只有 3 个,未显著) |
| 33.3% / 50%(H2) | −23.1% / −14.5% | 人向 agent 挪得更多 |
| 75%(H3) | 回升到 0.725,与 H1 相当 | 人向 agent 的同化占主导 |
强度接近,所有权不同。33.3% 的 agent 已经贡献终局词表的 60.7%;概念层要到高比例才接管,75% 时概念贡献 100%。CLR 在 12.5%/33.3% 小于 1(只做用词锚),50%/75% 升到 1.24 / 1.27(开始改语义骨架)。
H1 到 H3,说法从具体、整体、有类比、有动作,变成抽象、零件枚举、静态几何:
| 维度 | 人类主导 | Agent 主导 |
| 具体度 | 2.986 | 2.724 |
| 命题密度 | 5.419 | 5.321 |
| 类比比例 | 0.802 | 0.050 |
| 整体比例 | 0.685 | 0.353 |
| 事件框比例 | 0.385 | 0.000 |
词云一侧是 rabbit / sit / background,一侧是 triangle / square / asymmetrical。
开局 agent–agent 相似度就远高于 human–human(共享预训练先验)。早期人的 adoption 显著高于 agent,后期两边都更 persistence,但人的行为摆幅更大。33.3% 上把 agent 拧成高采纳:共识强度不变,CLR 从 0.599 掉到 0.342(−42.8%)。拧成高固执:共识再降 9.6%,CLR 升到 1.304(+117.8%)。换成 7B:共识从 0.534 回到 0.725,CLR 降 22.9%。弱模型圆与圆之间站不稳,吸不住人。
问卷:H3 被试对终局描述的认同更低,却更觉得是 AI 在领导。H1/H2 里,对方被判成 AI 时采纳意愿更低;H3 这个缺口收窄甚至反号。OLS:感知 AI 身份 β=−0.463,自身–同伴相似 +0.195,同伴相对群体质心 +0.229。身份抵抗和从众压力对着干,高比例时从众压过抵抗,人采纳了自己并不满意的说法。
混合群体是另一类社会系统,不能用「加人工具、分数变好」来外推。想保人类对规范的署名,低比例(约 12.5%)最合适:agent 当催化剂,自己去迁就人类词空间。想拖住过早收敛,中比例会把两边拉扯着,共识变弱。高比例会重新收紧,但收紧到更抽象、更不好记、更难带新人的几何说法上,而且人对此的抵抗会自己松开。作者把它连到「恶意 AI 蜂群伪装草根共识」:不需要指定调解人,也不需要精心写的劝说稿,普通反复配对就够。透明度不是装饰;藏身份等于关掉人用来过滤的那道阀。
刺激是无内容立场的抽象图形,没有权力差、没有情绪、没有利益。交互是全混合随机配对,真实社区有意见领袖和瓶颈。主实验一个模型家族两个能力档,相变边界的数字可能随模型变。H3 一组只有 6 个真人,部分跨档检验统计功率不足(感知 AI 领导 p=0.060;质心压力随比例升高 p=0.170)。内容三维靠 LLM-as-judge(Qwen2.5-72B),与主 agent 同门。共识强度是 embedding 余弦,不是能否让第三人指认成功。代码宣称开源,数据写「论文及补充材料已含评估所需」。