经济世界模型分六级:737 篇综述发现制度演化与真世界对齐近乎空白

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

cs.AI, cs.LG

2026-08-06

经济世界模型是模拟经济体从内部演化的生成环境。737 篇综述排出六级能力阶梯:智能体越来越聪明,但制度演化与真世界对齐近乎空白。

这篇在解决什么

经济学长期靠「观察再解释」推进:经济学家记录宏观变量、收集微观证据、估计因果,然后问是什么导致了什么。这套范式能预测拐点,却答不了一个更深的追问:一个经济现象,能不能从模型内部自己「长」出来。导出均衡、拟合参数,并不等于解释了这个现象是怎么发生的。

这篇要把经济学从「事后解释」推向「生成式模拟」。它提出的 Economic World Model(EWM,经济世界模型)是一台生成式引擎:把异质的经济主体(家庭、企业、银行、监管者)、他们的信念与行动、以及市场和制度,一起塞进一个可计算的环境里,让宏观经济状态从这些主体的互动中自己涌现出来。背景是 AI 圈正在把「世界模型」从物理环境推广开来,而 OpenAI 在 2024 年任命了首位首席经济学家、Anthropic 上线了经济指数,说明产业界也想搞清 AI 的经济后果。问题是这件事现在做到哪一步、缺什么。

方法

作者把 EWM 写成一个状态转移算子 s{t+1} = T(st, ut):当前经济状态加上外部干预,生成下一个状态。和物理世界模型的关键差别在于转移由谁驱动。物理世界里物体怎么动取决于外部定律,跟物体「信什么」无关;经济世界里,下一个状态是那些会形成信念、会算计、会改主意的主体自己造出来的。

围绕这个定义,他们给出一条四级模块化的运行时:主体层(异质经济主体的目标、信息、约束、记忆、可行动作)、环境层(经济状态、市场机制、合约、会计恒等式、制度规则)、协同演化层(让主体、策略、机制、制度在反复模拟中演化)、真世界对齐层(拿模拟轨迹跟实证观测比对,纠正漂移)。理想形态是「智能体经济」:主体在 EWM 里训练,变强后再回灌进 EWM 自身的主体,提升状态预测,形成自我增强的闭环。

真正承重的是一条六级能力阶梯,作为实现成熟度的分类标尺:

级别名称标志
L1固定规则主体主体与环境遵循预设规则,无在线适应
L2自适应规则主体主体用 RL、进化或在线学习更新决策规则,但无丰富信念
L3LLM 自主主体主体具备信念、记忆、语言与推理
L4自演化主体主体持续累积新策略、技能、工具
L5主体-环境协同演化制度、规则、治理随结果内生变化
L6仿真-真实经济孪生在线用真实观测纠正模拟轨迹

这套阶梯只量「实现能力」,不保证经济学意义上的反事实一致性,后者要靠 Cong(2025)提出的 DDGE(数据驱动生成式均衡)框架补上。

为了量出这个领域站在哪一级,作者做了系统综述:从 arXiv 八个类目和 UTD-24 商科期刊里检索,合并去重得到 7,836 篇候选(6,008 篇 arXiv 加 1,828 篇 UTD-24),再用两阶段 LLM 筛选(GPT-5.4-mini 看摘要、GPT-5.5 做全文分级),边界和低置信案例交人工复核,最终确认 737 篇 EWM 论文。

结果

综述本身没有跑任何实验,它的「结果」是这 737 篇的分布画像,几条结论很清楚。

智能体是近年进展的主战场。2018 年后稳定增长,2024 至 2025 年骤升,新增几乎全堆在 L1 至 L3,尤其是带学习和推理的 LLM 自主主体。商科期刊则集中在底层,UTD-24 那一面几乎全在 L1 和 L2,经济纪律严、制度结构清楚,却很少用 LLM 自主主体,没有持续自演化,也没有真世界对齐。这中间是一条分工:arXiv 推新 AI 能力,商科期刊提供更扎实的经济建模传统。

高层近乎空白。L4 至 L6 在整个图谱里只是窄窄一条;L5 的内生制度演化很稀少,说明大多数模拟仍把经济环境当成不变的舞台;L6 的仿真-真实孪生几乎不存在,只有极零星用真实数据反复纠错的早期原型。一句话,领域把主体做得越来越聪明,却还没解决把自演化主体、演化制度、在线真世界对齐塞进同一个经济世界这个更难的系统工程问题。

为什么重要

对从业者,这张阶梯是张地图,告诉你能动手的位置和还没人占的空地。如果做 agent 训练环境、策略沙盘、政策前测、或 AI 安全测试床(检测操纵、合谋、级联失效),高层那几级是真正值钱也真正缺的位置。论文把应用讲得很实:对人,它是高保真沙盘;对 AI 主体,它是训练、规划、评估、安全的基底。

但要诚实标一句:这是一篇综述加框架提议,作者没有亲手搭出一个 L6 系统,也没有给出任何实证评估。它的价值在划清问题、给出分类标尺和接口起点,而不是端出一个可用系统。把它当路线图读,别当成品读。

局限与存疑

最根本的一条:框架提议,无实证验证。六级阶梯、四级运行时、协同演化闭环,目前都是设计层面的主张,没有跑通一个端到端的高保真经济世界来证明它站得住。

分级靠 LLM 做(GPT-5.5 全文分级),带主观性,边界靠人工复核,737 这个数和各级占比会随分级口径漂移。作者也自陈开放挑战:行为真实性怎么对齐真实行为数据、经济闭合(非线性的聚合怎么既守经济可行又可扩展)、协同演化(演化什么、何时演化、怎么防止漂移)、计算与工程可扩展性、世界级评估(反事实世界没有唯一真值轨迹)。

它建构在 Cong(2025)的 DDGE 之上,而那是篇工作论文,反事实一致性的那套理论本身也还没被验证。最值得跟进的缺口是 L5 和 L6,也就是让制度和真实数据进入闭环。

术语

原文与代码

相关论文

全部论文解读