Code World Model:用代码维护世界状态,让视频模型只管画面
新智元 · wechat · 2026-09-07
西湖大学 AGI Lab 与南洋理工大学团队提出 Code World Model,核心思路是把世界模型的职责拆分:coding agent 通过编写和修改代码维护可执行的 world state,负责目标、规则与长期因果;视频模型则只负责生成精细的视觉画面。两者之间用「proxy」衔接——从 world state 编译出的粗粒度视觉骨架(分辨率仅约目标视频 1/16),为视频生成提供逐帧的空间约束。
训练数据来自约 5.6 小时的游戏运行时录制,同一执行同步记录 RGB 与状态,编译出 9,420 个严格对齐的 5 秒训练片段。原型采用 MiniMax-H3 视频 backbone 加 rank-128 LoRA(约 5.96 亿可训练参数,8 张 H800 训练),推理时由 GPT-5.6 Sol 充当 coding agent。结果显示,仅用少量数据 LoRA 适配,模型即可让同一套 proxy 骨架呈现为不同身份与画风的角色,同时遵循指定的位置、轨迹与相机运动。论文链接与项目主页已开源。
「研究」频道最新
- 数学将像物理一样烧钱?大佬预言前沿数学进入「大数学」时代 — sytelus · 2026-09-23
- Cohere Labs 访谈质疑 scaling law 可靠性,给出研究可靠性清单 — Cohere_Labs · 2026-09-23
- SoL-Pi 论文细节:每小时省 $4-13 的 agent harness 自动优化 — alex_verem · 2026-09-23
- NVIDIA SoL-Pi:AI 自动改写 agent harness,token 省 45-49% — alex_verem · 2026-09-23
- RL 框架 Slingshot 对 Qwen2.5-32B 攻击成功率 67%,零样本迁移至 Gemini — j_foerst · 2026-09-23
- TLAPS-Bench 开放 alpha 版:测 AI 能否形式化证明系统正确性 — tianyin_xu · 2026-09-23