Code World Model:用代码维护世界状态,让视频模型只管画面

新智元 · wechat · 2026-09-07

西湖大学 AGI Lab 与南洋理工大学团队提出 Code World Model,核心思路是把世界模型的职责拆分:coding agent 通过编写和修改代码维护可执行的 world state,负责目标、规则与长期因果;视频模型则只负责生成精细的视觉画面。两者之间用「proxy」衔接——从 world state 编译出的粗粒度视觉骨架(分辨率仅约目标视频 1/16),为视频生成提供逐帧的空间约束。

训练数据来自约 5.6 小时的游戏运行时录制,同一执行同步记录 RGB 与状态,编译出 9,420 个严格对齐的 5 秒训练片段。原型采用 MiniMax-H3 视频 backbone 加 rank-128 LoRA(约 5.96 亿可训练参数,8 张 H800 训练),推理时由 GPT-5.6 Sol 充当 coding agent。结果显示,仅用少量数据 LoRA 适配,模型即可让同一套 proxy 骨架呈现为不同身份与画风的角色,同时遵循指定的位置、轨迹与相机运动。论文链接与项目主页已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →