SocioVerse2: A Longitudinal Dynamic Social Simulation Framework under a Human-AI Co-evolutionary Paradigm
Xinnong Zhang, Jiayu Lin, Jia Wang, Yixu Huang, Xinyi Mou, Yingqian Wu, Jingcong Liang, Shijun Lei, Jianing Shi, Guanying Li, Siyuan Wang, Hanjia Lyu, Zhenfei Yin, Yunlu Yin, Siming Chen, Yulan He, Jiebo Luo, Xuanjing Huang, Liyin Jin, Baohua Zhou, Hanqi Yan, Zhongyu Wei
cs.CL, cs.CY
2026-09-22
SocioVerse 2用回放做反事实分叉。十个ABM上DeepSeek-V3一致性0.900,规则上限0.911。
社会模拟要能改条件,并留住对照。Generative Agents、Concordia、OASIS 跑完就不能再干预。HiSim、AgentSociety、SocioVerse 1.0 把人口对齐真实社会,比较停在横截面,换人口就要重采。YuLan-OneSim 和 AgentSociety 2 把流程交给自治 agent,人多半只在暴露出来的节点上批准。已有审计里,这类 agent 会编结果,也会偏离计划。
复旦等团队的 SocioVerse 2 把 1.0 收成两个环。纵向环沿时间推动人口,并分叉出反事实。研究环把设计本身当成可编辑状态。人口和环境各走一套服务。
式子是 B = f(P, E)。人口、环境、行为函数可以单独换。f 可以是经典规则、LLM、强化学习或混合。上一步的集体行为改写下一步环境。课题状态另外装着指标、资源清单和种子。改其中任何一块,就得到下一版。
一步分五拍。先兑现到期的事件和广播,研究者声明的干预也从这里进入。每个 agent 按物理或信息、广播或点对点拿到观察,再交出带类型的动作和来源标签。回合结束时同步写入面板。记忆默认 8 步,而且能从面板原样重建。规则和 LLM 因此落在同一个动作空间里。
反事实用回放完成。干预 δ = (t, op) 指定在第 t 步改一次环境。此前的动作按父运行面板重放,决策模型不调用。从这一步起才重新决策。人口、行为函数和种子保持不变,之后的指标差只属于这次操作。只改环境并继承历史,叫做分支。换人口、换行为函数或换数据、不继承历史,叫做版本。版本会把整个工作区做快照,父版可以退回。
人口侧的 MCP 是类型化接口。五个池本地可查 10,448,375 条,X 有 973,928 条,小红书有 9,158,404 条。抽样本之后用 IPF 重加权到普查边际。对不上的格子,合成并打上合成标签,或剔除并报告缺口。环境侧接 21 个以上信号源,查询按年月只返回当时已经公开的版本。正式运行只读工作区里的事件包。整条技能链默认停在人工检查点,也可以开自动模式跳过。
机制复现给出了完整对照。十个经典 ABM 覆盖流、市场、组织、扩散,40 到 810 个 agent,30 到 200 步。ABM 就是用局部规则推出群体模式。一致性等于 1 减去相对均方根偏差。规则模型用 10 个种子互测,平均 0.911,当作该协议的噪声上限。三个 LLM 各 3 个种子,温度 0.7,输出最多 256 token。
| 方法 | 指标 | 结果 |
| 规则对照 | 十任务平均一致性 | 0.911 |
| DeepSeek-V3 | 十任务平均一致性 | 0.900 |
| GPT-4o | 十任务平均一致性 | 0.898 |
| Qwen3-235B | 十任务平均一致性 | 0.885 |
DeepSeek-V3 距上限 0.011,三个模型相差不超过 0.015。任务结构比换模型更能带动分数。
Schelling 用 20×20 网格、400 人、阈值 3/8。只喂标量邻域时,LLM 第 12 步全员满意,和规则同一条路线。写成自然语言并加上搬家成本、耐心之后,终点仍是完全隔离,推到第 18 步。加上下文改的是节奏。
囚徒困境上,三个 LLM 都明显低于几乎自我同一的规则对照,正文没有这项分数。连续航向会把小偏差全额计入。观点动力学连规则都是套件最低分,LLM 并不更差。少数者博弈上,GPT-4o 和 DeepSeek-V3 高于规则对照。
混合舆论用真人。每个运动 1,000 人:300 个 LLM 核心用户,700 个规则用户,14 步,每步 12 小时。镜像 agent 把核心立场写进规则层,反向不建模。立场准确率 MeToo 0.968、Roe v. Wade 0.943、BLM 0.899,F1 只有 0.340、0.336、0.374。内容相似度 0.806 到 0.841,类别准确率 0.642 到 0.735。行为准确率 0.667 到 0.780,行为 F1 为 0.469 到 0.576。
设计表上另有五项,每项只跑 1 次。芝加哥 19,235 户、15 步,对照 2010 普查和 5 个规则模型。药品 325 个市场、50 轮,对照历史中标、纯企业策略和随机。消费者信心 25 万户、75 个月,对照官方 CCI 和 12 个基线。采购经理指数 300 家企业、22 加 32 个月,对照官方 PMI、持续性基线和一致预期。德国车市 600 人、41 个月,对照上牌份额。
能带走的是版本树。换人口、换行为函数、换数据版本都可以退回父版。分叉之前只重放面板。设计上 LLM 只驱动几百个核心用户。
0.011 是一次复现。动作离散、规则已经讲清机制时,LLM 落在规则自身的重复波动里。摘要还把宏观 nowcasting 放到响应模型的知识截止之后,用当时已公开的信号估计同期官方指数。这句不能用 ABM 一致性来支撑。
平均分把失败任务盖住了。囚徒困境和连续航向没有逐项分数,LLM 又只有 3 个种子,对着规则的 10 个种子,0.011 站不稳。
立场的两个数对不上。准确率 0.968 旁边是 F1 0.340,多数类就能把准确率撑起来。镜像耦合沿用旧设定,是单向的。五项应用都是单次运行,月度序列贴上官方曲线时,机制和抽样混在一起。人进入两个环这件事没有纯自治对照,自动模式还可以把检查点关掉。小红书占了本地画像的绝大部分。MatrAIx 只校准一维边际,并不代表真实人口。合成格子再被当成真人读,外部效度就是虚的。