Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu
cs.CV
2026-08-28
把物理世界写成可执行代码,用提出-仿真-渲染-校验循环从文本或视频反推机制,再拿验过的世界训练 VLM。9B 模型在 QuantiPhy 上平均 MRA 55.4,超过 Gemini-3.1-Flash。
视觉语言模型已经能认出杯子掉了,也能用文字说「重力」,但很少把杯子的质量、接触和动力学写成一套能跑、能改、能量的机制。像素预测只要画面像就行,互相矛盾的内部解释可以给出差不多的未来帧。三维重建能保住几何,却不自动回答支撑撤掉之后为什么会掉。语言描述又很难把摩擦系数和轨迹精度写进去。
缺的是一种既可组合、又能定量、还能拿去干预的世界表示。Code-as-World 的做法是把任务相关的物理世界写成可执行代码,再把它当成可检验的科学假说。
可执行世界表示拆成三块:物理构成(物体、尺寸、质量、摩擦、重力、地板这类会参与接触的结构)、动态演化(初态、力、事件、时长)、视觉外观(相机、材质、光照)。改一块不必重写全部。执行时优先保证物理等价,不追求像素级复制。
从文本到视频都走同一套提出-实例化-执行-渲染-校验循环。文本先抽实体、空间关系和意图结果,缺口用物理先验补;视频则用分割、深度、跟踪和三维网格把观测压成视觉证据。智能体给出一份代码假设,编译进仿真器跑出状态轨迹,再渲染回图像、深度、掩膜和轨迹,跟证据对不上就局部改构成、演化或相机,最多五轮。验不过就拒绝,不硬编一个看起来像的世界。
验过的世界再拿去训练视觉语言模型。图像平面上学测长度和运动;世界坐标系里学用物理先验把单目视频校准成真实尺寸、位移、速度和加速度。27B 推理版会先写出测量与标定过程,再吐最终标量。
在 QuantiPhy 验证集上按官方协议报 Mean Relative Accuracy(MRA,按相对误差分档给分),四个运动学子集再取宏平均:
| 模型 | 规模 | 2S | 2D | 3S | 3D | 宏平均 |
| Gemini-3.1 Flash | — | 49.4 | 47.5 | 61.4 | 61.1 | 约 54.9 |
| Qwen3-VL-32B-Instruct | 32B | 38.1 | 39.7 | 39.8 | 43.0 | 约 40.2 |
| Code-as-World-VL-4B | 4B | 45.4 | 55.4 | 45.8 | 56.0 | 50.6 |
| Code-as-World-VL-9B | 9B | 55.0 | 52.9 | 55.6 | 58.1 | 55.4 |
| Code-as-World-VL-27B(推理) | 27B | 48.7 | 62.4 | 60.5 | 62.8 | 58.6 |
9B 直接作答已经超过 Gemini-3.1-Flash 和所有列出的开源基线。4B 也能打到 50.6,明显强过同尺寸的 Qwen3.5-4B。27B 把规模和推理协议一起换了,论文把它当成框架可放大的证据,不当成「只加思维链」的受控实验。
发现循环这边,五轮迭代在视觉对齐、物体 IoU、轨迹 ADE 和 2% 画面对角线精度上优于同等评估预算的 Best-of-5 独立采样。文本驱动的世界还能改初速或相机后再仿真,用视频生成模型做成更像真的画面,运动仍跟代码世界对齐。
物理监督一直缺标签:网上视频几乎不带真实速度和加速度。把世界写成能跑的代码,等于给单目度量推理造了一条可扩展的标注管线。做物理 VLM、可编辑仿真数据、或者要反事实视频的人,这条路比再堆描述性问答更接近机制。
9B 超过更大专有模型,说明监督信号的结构可能比再加参数更值钱。代码世界还可以直接改参数重跑,这种可干预性是像素特征和自然语言都给不了的。
仿真器覆盖不了真实世界的全部物理。地形、接触几何、材料差一点点,刚体运动都会走样;过程一旦落在仿真器建模范围外,循环可能收敛到局部说得通、机制并不对的代码。QuantiPhy 主要考单目尺度标定下的尺寸、位移、速度、加速度,接触、形变、流体和长程多体都不在范围内。
落下来的 VLM 只吃到发现循环的产物,没有把提出假说、仿真、诊断、改写内化成模型自己的能力。27B 的增益和推理协议缠在一起,不能单独归因于思维链。