From Generation to Simulation: How Far Are World Models from Being True Simulators?
Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao
cs.AI, cs.CV
2026-08-24
用传统模拟器八项能力审计2018至2026年200篇世界模型。交互和可控性已能在特定场景顶上,可查询实体物理接口只有6/163,离真模拟器还差结构能力。
视频扩散和世界基础模型把「世界模型当模拟器」从口号变成了可演示的产品形态:GameNGen 能在受限游戏域跑到约 20 FPS,Matrix-Game 系列报到 720p、约 40 FPS。Ha 和 Schmidhuber 2018 年那套 VAE 加 RNN 的想象训练,已经被 Dreamer、Genie、Sora 讨论和 Cosmos 平台推到了驾驶、操作和开放探索。问题是,现有综述多半按架构、功能或应用域给世界模型自己分类,量不出它离物理引擎、游戏引擎、RL 环境还有多远。
这篇换了一把外尺:传统模拟器的八项能力。尺度独立于任何技术路线,所以 latent dynamics、视频生成和 JEPA 可以被投到同一张能力图上。
文献从 Google Scholar、arXiv、DBLP、Crossref 收,截止 2026 年 6 月 30 日,再沿六篇综述和 World Models、DreamerV3、Genie、Cosmos 的引文链补漏。纳入标准是:接受动作或条件输入,并向前 rollout 出未来状态。排除纯文生视频骨干、无动作条件的表征学习、只预测物体轨迹的模型,以及标题带 world model 但实际是语言模型编码或认知建模的工作。最终 200 篇,其中 163 篇实现、18 篇评测基准、16 篇综述。72 篇已正式发表,128 篇仍是预印本。
实现论文按六族划分:latent dynamics / latent action 29 篇,自回归 37 篇,扩散 63 篇,JEPA 5 篇,显式 3D/4D 25 篇,occupancy 4 篇。每篇标 1 到 3 个主贡献能力。对 163 篇实现另做五级状态接口审计:B1 自车/本体信息,B2 传感器输出,B3 奖励与终止,B4 运行时可查询的非自车实体或物理参数,B5 闭环交互。有、无、证据不足分开记,避免把没写清楚当成没有。
按「是否作为主贡献」计,研究注意力严重偏斜。可控性出现在 125 篇(62.5%),交互和稳定性各 80 篇(40%)。资产构建 38 篇(19%),物理引擎约 17%,状态反馈 45 篇(22.5%)。作者把前三项标成相对强项,后三项标成跨路线结构缺口。
状态接口是这篇最硬的数字。B1 确认存在 65 篇,B2 45 篇,B3 20 篇,B5 87 篇。B4,运行时可查询的命名实体或物理参数,只有 6 篇,157 篇明确没有,0 篇存疑。RGB 之外的传感器输出也只在 45/163 里被明确报告。GameNGen 的人类辨认实验里,只有 58%–60% 的人能分清真实和生成的 Doom 画面,视觉像真模拟器;查询接口不像。
V-JEPA 2-AC 把规划耗时从像素生成的约 4 分钟压到约 16 秒,大约 15 倍,但输出是不可读的表征。路线融合已经出现:因果 forcing 蒸馏、少步自回归扩散、显式 3D 记忆加隐式外观、VLA 与世界模型合一。论文的判断很干脆:特定场景下,交互和可控性已经能功能替代;物理定律的形式保证、结构化状态反馈、可复现的长程演化,还差关键一步。
做具身、驾驶或游戏 RL 的人,如果打算用世界模型换 MuJoCo、CARLA、Unity,这篇把「看起来像」和「接得上」拆开了。接策略、做闭环评测、做安全分析,缺的是可查询的实体状态,不是更高的 FVD。六条后续方向也按缺口来:可验证物理、统一动作接口、把状态反馈当一等公民、长程稳定、用下游成功率而不是生成质量评、跨路线融合。World-in-World 已经报过视觉质量不等于任务成功,方向不是空的。
能力标注量的是研究注意力,不是能力达标。一篇做了物理但没把它当主贡献,不会进物理那一栏。JEPA 只有 5 篇、occupancy 只有 4 篇,不能按族排名。纳入标准砍掉了纯视频生成,覆盖会偏向「带动作的生成」。128/200 仍是预印本,字段依赖作者自述,B1 还有 24 篇证据不足。语料止于 2026 年 6 月,之后的工作不在图里。作者没有给出与传统模拟器的绝对对照实验,差距是结构性清点,不是同一任务上的误差曲线。