Modeling Earth-Scale Human-Like Societies with One Billion Agents
Haoxiang Guan, Jiyan He, Liyang Fan, Zhenzhen Ren, Shaobin He, Xin Yu, Yuan Chen, Xueyin Xu, Shuxin Zheng, Yan Gao, Enhong Chen, Tie-Yan Liu, Zhen Liu
cs.MA, cs.AI, cs.CL, cs.CY, cs.SI
2025-06-07
Light Society 把社会过程建模成智能体状态的受控迁移,用知识蒸馏出的替身模型顶替大部分大模型调用,首次实现十亿级智能体的社会模拟。
想用计算机模拟社会现象,一直卡在两头。一头是基于规则的传统智能体模型(ABM),行为靠人工设定,简单刻板,模拟不出真实的人类决策。另一头是最近用大模型驱动的智能体,行为倒是逼真,但贵得离谱:此前的工作要烧几十张 GPU、跑几周,才能模拟到百万级智能体。再往上做到「地球级」(十亿人),算力上几乎不可行。
Light Society 要解决的就是这个规模瓶颈:既保留大模型智能体的高保真行为,又把模拟规模推到十亿智能体。
框架把社会模拟形式化成一个元组:时间线、智能体状态、环境状态、事件、事件队列,以及一组驱动状态转移的操作。智能体状态分静态档案(人口学属性)、内部状态、外部状态三层;环境也有静态和动态两部分。所有变化由六个大模型驱动的操作完成:初始化、感知、决策、智能体演化、环境演化、更新。这套形式化把「人怎么互动、社会怎么变」统一成状态的受控迁移。
关键在怎么省算力。核心是 mixture-of-models(混合模型)引擎:同一个操作,复杂推理交给完整大模型,常规决策路由给用知识蒸馏训出来的替身模型(surrogate),还有预计算查表兜底。替身模型是 embedding-MLP,用大模型生成的交互样本蒸馏而成,顶替掉绝大多数调用。系统层面再叠四层优化:SHA-256 键控的 LRU 加 FAISS 语义缓存复用提示;十亿节点图用 CSR 格式压进 HDF5;按字段用 numpy 数组做向量化批处理;同一时刻同一优先级的事件成批出队。
人口数据来自世界价值观调查(WVS)第 7 波,清洗后 96,125 条有效档案,转成带地理位置、性别、年龄、教育、就业、收入、信仰、族裔、自评阶层的自然语言人设,让智能体有真实的人口结构。
两个旗舰实验。第一个是信任博弈(Trust Game),用 gemini-2.0-flash-001 驱动。单轮平均送出 41/100,落在人类实验常见的 40% 到 50% 区间内。人口学规律浮现:上层阶级比下层送得多,研究生学历比无正规教育更信任他人;16 到 34 岁与 55 岁以上两组的送出差距,会随人口规模增大而显著放大、置信区间收窄。迭代版(最后通牒博弈)10 轮里平均送出从 40.0 降到 26.9,拒绝率在第 7 轮触顶 19.0%。
第二个是观点扩散,跑到十亿智能体的 BA 网络。前 20% 高度数节点当影响者,后 80% 当被影响者。关键看替身模型保不保真:纯大模型基线下,5 次重复的逐轮变异系数(CV)在 0.0038% 到 0.0060%;混入 50% 替身后,CV 升到 0.14% 到 0.34% 量级,轨迹仍定性一致。替身选型上,他们比了五种架构(Softmax 回归、LightGBM、MLP、Transformer、Qwen3-0.6B 小模型),Martian-city 话题的宏 F1 都聚在 0.84 到 0.85,但「变化率差距」从 MLP 的 8.6 个百分点到 Softmax 回归的 19.4 个百分点不等。最终选了变化率差距最小的 embedding-MLP(2.48%),而不是 F1 最高的检查点(差距 7.14%)。
规模的横向上,此前同类系统从几十到约 10 的 7 次方智能体,Light Society 到 10 的 9 次方。
这篇真正的贡献是工程和方法上的:它给出了一条把大模型社会模拟做到行星尺度的可行路径,而这条路径的核心手段(用蒸馏替身顶替大模型)是可以迁移的。任何「单个智能体要调一次大模型、但绝大多数调用其实很常规」的大规模模拟,都能套这个思路。替身选型的细节尤其值得记:挑替身不能只看逐样本准确率,F1 相近的模型在分布层面的差距能差好几倍,得按最终关心的群体指标来选。
对研究者,这意味着社会模拟从「演示性小实验」走向「可做假设检验的规模」。论文也诚实标注了哪些结论可信、哪些受模型选择影响。
作者自己列了几条。第一,行为基线依赖具体大模型:同样跑信任博弈,换一个 LLM,送出金额会整体漂移,所以绝对数值不能脱离所用模型解读。第二,沟通语言影响结果:同一话题用中文还是法语跑,立场转变率最多差 4.7 个百分点。第三,替身选择本身有风险,逐样本准确率不足以判断分布保真度。
需要警惕的一点:十亿智能体的观点扩散结果,主要是替身模型跑出来的,不是十亿次真实大模型推理。替身在小规模上验证过定性一致,但外推到十亿节点、长时间跨度时,误差会不会累积放大,论文没有给出充分证据。另外,框架明确声明是用来研究社会动力学,不是用来执行信息操纵,但在十亿规模上模拟观点扩散,这套工具的双刃性质是显而易见的。