编码智能体当世界大脑,代理视频约束 MiniMax-H3

Code World Model: Coding Agent as World Brain

Yiwen Chen, Guosheng Lin, Chi Zhang

cs.CV, cs.AI, cs.CL

2026-08-26

编码智能体用代码维护持久世界状态,再编译成粗代理视频去驱动 MiniMax-H3。目前只有 5.6 小时 GTA 微调后的定性结果,正文没有定量对照。

这篇在解决什么

视频世界模型把交互世界写成「给定动作,生成下一段画面」。画面质量、长程一致和记忆都在补。视频记录的是结果:游戏每一帧由固定代码渲出,那段可执行逻辑渲完就丢,模型只能从稀疏的视觉后果反推规则。屏幕外的状态没有连续记录,跨地点、跨很长时间的因果更稀疏。把数据堆上去,看到的仍是结果,不是机制。

开放世界还要求后果能持久。刺杀城主之后,继承、治安、派系、NPC 目标要在玩家离开后继续演化,回来时对得上。这需要可检查的世界状态和可复现的规则,不是下一段好看的视频。

方法

Code World Model 把演化与外观拆开。编码智能体当世界大脑,处理低频、语义重的决策:读状态、推断事件后果、选用或改写机制,再写成可执行代码。代码跑高频、重复、确定性的更新:位置、碰撞、冷却、数值规则。智能体不必逐步代跑整个世界,世界程序也可以被改,不是冻死的游戏脚本。

可执行状态不能直接塞进视频模型。结构化文本控不准相机轨迹和实体运动;完整 3D 资产管线贵,还会提前锁死外观。折中物叫 proxy(代理):用少量可组合的粗糙图元记下相机、实体位置、姿态、轨迹和空间关系,确定性编译器渲成低分辨率代理视频。实现里空间分辨率是目标视频的四分之一,视觉 token 大约十六分之一。文本管外观、身份和动作语义,代理管这一帧必须遵守的时空约束。精细动作和物理细节留给视频模型的先验。

训练对从游戏运行时同步录:目标 RGB 和构造代理所需的状态一起拿,丢掉完整模型、贴图和骨架级关节,因为现有编码智能体推不稳那一层。原型用 GTA V 约 5.6 小时、157 条 takes,切成 9420 条 5 秒片段。KITTI-360 上用标定位姿和语义重建离线编译代理,证明真实视频也能对齐,且不需要动作标签;报告里的视频模型微调仍走游戏数据。

推理用 GPT-5.6 Sol 当编码智能体,在现成 AAA 场景和玩法模板上改写,不是从零搭开放世界。视频骨干是 MiniMax-H3 的 Ref2VA,rank-128 LoRA 覆盖 50 个 Transformer 块,约 5.96 亿可训参数,8 张 H800、3 个 epoch、3534 步。每段 124 帧、1344×768、24 FPS;首帧外观锚点由 GPT Image 2 按第一帧代理和文本生成。长视频用 34 帧重叠的滑窗往前滚,每次新出 90 帧。

结果

实验几乎全是定性。代理规定的角色位置、运动、场景布局和相机轨迹能被跟上,同时保住细节和局部动态。训练只见过 GTA,提示里却能出完全不同的角色和画风,代理约束的是时空结构,外观主要靠文本和预训练先验。更细的时序对照放在项目页,声称比动作或相机条件的视频世界模型更跟手。正文没有 FVD、控制误差或用户实验数字。对比也不计推理延迟。

真实数据只证明代理可以从重建几何编译出来。KITTI 对没有拿去训视频模型,也没有真实域生成指标。

为什么重要

这条分解针对视频世界模型的结构缺陷:规则和后果不该只活在像素历史里。代码可检查、可测试、可改;视频模型继续贡献外观和运动先验。代理比更长的文本提示更像引擎状态,又比完整 3D 仿真便宜。做交互世界或具身训练环境,可以把这套接口当控制面:状态在代码里,画面用生成。

当前证据撑起的是接口可行性,撑不起已经能开放演化。

局限与存疑

作者写了两条。算力不够,训练规模小,生成质量有限,也没做自回归实时生成。现有编码智能体还不能可靠地从零实现复杂游戏机制,原型没有展示自主搭建完整开放世界。

还有几条正文没当局限写。没有定量对照。编码智能体是在现成 AAA 场景上改,世界演化的硬工作很大一块仍是游戏引擎。首帧依赖另一个图像模型。代理的分辨率和原语集合是固定设计,按任务开关代理写在更大的范式里,这篇没做。GTA 5.6 小时 LoRA 三轮,撑不住开篇「接近真实世界因果复杂度」的目标。题图也标明是 AI 生成的示意。

术语

原文与代码

社区讨论

相关论文

全部论文解读