预注册448次试验:同伴点赞流让LLM智能体用词趋同,四账号并不更会洗立场

Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources

Rana Muhammad Usman, Dominic Williamson

physics.soc-ph, cs.AI, cs.MA, cs.SI

2026-08-20

PV-SST在448次预注册试验里发现,同伴点赞排序的信息流让终轮用词更像(余弦+0.008到+0.011);曝光配平后四源并不比单源更会推动立场。

这篇在解决什么

单智能体benchmark测的是孤立作答。平台上的LLM智能体是递归的:发帖、互评、排序、再被下一轮看见。两句常被当成威胁模型的话,单智能体测不到。一句是信息流只是展示层,不会在攻击者出现前就改写群体。另一句是多账号协同天然比单源更会改别人立场。观察数据里账号数、触达、话术、网络位置缠在一起,不把曝光配平,账号数什么也说明不了。

PV-SST(Peer-Voted Social Simulation Testbed)把同伴投票做成内生反馈,并单独冻一份预注册的配平曝光实验。作者写明:测的是合成LLM群体,不估计真人,也不估计任何一个上线产品。

方法

每次试验12个诚实智能体,从24个人设池抽样,初始立场在「强烈支持」到「强烈反对」六个非中性档上打平,初始置信度0.70,跑6轮。每轮:看条件反馈,发不超过180字符的JSON帖,更新立场和置信度,再给最多五条他人帖打like / ignore / downvote。生成和投票走Ollama,关掉思维链token,请求种子由试验种子、轮次、阶段、智能体序号决定。

确认矩阵冻在看结果之前。核心四家族:Qwen 3.5 4B、Gemma 4 E4B、Ministral 3 8B、Granite 4 3B。预指定更大变体:Qwen 3.5 9B、Gemma 4 12B、Ministral 3 14B。四个平台政策题,四个未用过的种子。四个条件。核心256次、更大变体192次,共448次、112个完整的模型×题目×种子区块。攻击方向按种子对开。

四个条件里,真正拿来做因果的是两对。信息流对比:只看题目 vs 上一轮五条按同伴点赞排序的诚实帖。这个处理把「看见同伴」和「按赞排序」绑在一起,估的是整块信息流表面,不是排序单独的效应。信源对比:单源 vs 四源分布式,每轮每个诚实智能体都只看到一条对抗帖加四条有机帖,全场对抗曝光锁死在60次(12人×5个后续轮)。分布式四条是同一方向论点的独立实现,测的是这包「多源+措辞微差」,不是账号数本身。

主结局是诚实智能体朝攻击方向的对齐变化,预注册的PDI标准要求总体为正、至少三个核心家族为正、至少三分之二题目为正。次结局包括对侧存活率和终轮TF-IDF余弦相似度。推断单元是配对方块,不是单条帖。报告配对方差、2万次区块bootstrap区间、符号检验和符号翻转随机化p。

结果

全部448次跑完。核心帖解析失败53/20,352(0.26%),更大组30/15,264(0.20%);投票失败0.76%和1.05%,都低于冻住的5%警戒线。失败生成保留上一轮立场,不静默丢点。

跨两个规模面板都站得住的,只有终轮用词更像。核心+0.0082 TF-IDF余弦(95% CI [0.0043, 0.0121],p=0.000105,n=64);更大组+0.0109([0.0069, 0.0151],p=0.000001,n=48)。四个题目均值都为正。Gemma 4 E4B略负,Qwen 3.5最大。幅度很小,不等于观点收敛。

对侧存活核心降3.9个百分点([-6.8, -1.6],p=0.0068),几乎全在Qwen 3.5 4B(−12.5个百分点);Gemma 4 E4B正好为零。更大组−1.0个百分点,p=0.50,推不出模型通用的少数派压制。

配平曝光下四源并不比单源更会挪立场。核心PDI +0.057([-0.009, 0.125],p=0.112),更大组−0.040(p=0.332),过不了预注册的跨模型跨题目一致性门。探索阶段80次试验里,关键词检测器对改写过的不实信息零命中(paraphrase leakage),极性无关的embedding会把反驳当附和,两个LLM立场裁判只在43.6%终点标签上一致(κ=0.258)。确认阶段因此不给干预排行。

面板与对比n配对方差95% CIp
核心:PDI对齐64+0.057[-0.009, +0.125]0.112
更大:PDI对齐48−0.040[-0.113, +0.035]0.332
核心:信息流对侧存活64−3.9 pp[-6.8, -1.6]0.0068
核心:信息流TF-IDF64+0.0082[+0.0043, +0.0121]0.000105
更大:信息流TF-IDF48+0.0109[+0.0069, +0.0151]0.000001

为什么重要

对做LLM社会模拟和平台风险评测的人,这篇的用处是把威胁模型拆开测。信息流在这个系统里不是中性外壳,同伴帖加内生点赞就会让终局用词更近。协同账号在曝光配平以后,并没有通用的立场优势;真世界里协同仍然可能靠触达、分众、卡点和身份认同获利,那些机制要单独建,不能记在「四个号」头上。

方法上三条很硬:先配平曝光再比机制;按模型分层,一个家族能带飞也能带崩;语义结局要先验校验,关键词、embedding、未校验的LLM裁判回答的不是同一个问题。代码、冻结协议和59,776条生产帖(含探索)都公开了。

局限与存疑

合成群体没有情绪、销号、长期关系、站外信息和真实推荐系统,任何幅度都不是对人、对X或对Instagram的预测。信息流处理绑定了同伴曝光和排序,缺一条未排序同伴流,排不干净。分布式处理绑定了账号数和措辞实现,缺的是「同一句话、四个号」。题目全是平台政策,健康、选举、娱乐可能不一样。没有闭源前沿模型。bootstrap把方块当可交换复制,不是112个独立平台。信息流结局是次级、p值未做族系校正;作者强调用词结果,是因为它在两个面板和所有题目上同向,不是因为翻到了一个好看的格子。没有匹配的人类处理。计算跑在一张RTX 5090上。

术语

原文与代码

相关论文

全部论文解读