DeepMind Genie:从无标注网络视频学出可控的生成式交互环境

Genie: Generative Interactive Environments

Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktäschel

cs.LG, cs.AI, cs.CV

2024-02-23

DeepMind Genie 从无标注网络视频无监督学出潜在动作,造出 11B 的逐帧可控生成式交互环境,动作还能迁移到新任务。

这篇在解决什么

要造一个能交互、可控制的「世界模型」,以往要么需要带动作标签的数据(游戏里能拿到,真实世界很难),要么只能做视频级别的整体控制、没法逐帧操控。互联网上有海量无标注视频,却几乎都没有动作标签。Genie 想从这些无标注视频里,无监督地学出一个可逐帧控制的生成式交互环境:给一张图、一段文字甚至一张草图当提示,就能生成一个能玩起来的虚拟世界。

方法

关键概念是 latent action(潜在动作):模型自己从相邻帧之间推断出一个离散的动作编码,无需真实动作标签。整套模型三个部分。一是视频 tokenizer(ST-ViViT),用 VQ-VAE 把视频帧切成离散 token,采用时空交错的注意力,计算量随帧数线性增长。二是潜在动作模型 LAM,只设 8 个码,用 VQ-VAE 目标从历史帧和下一帧推断动作,词表刻意压小是为了保证可控和人能玩。三是动力学模型,用 MaskGIT 做下一帧预测,把动作当加性嵌入。最终模型约 11B 参数。一个反复出现的工程选择是 ST-Transformer:空间层只看同一帧内、时间层只看同一位置跨帧,省显存。

结果

在自建的 Platformers 数据集上,11B 模型 FVD 为 40.1(pixel 输入 LAM),token 输入 LAM 是 38.8;tokenizer 消融里 ST-ViViT 拿到 81.4,纯空间 ViT 是 114.5,C-ViViT 是 272.7。

指标设置数值
Δt-PSNR(可控性)Genie, Platformers1.91
Δt-PSNR(可控性)token 输入基线1.33
Δt-PSNR(可控性)Genie, RT1 机器人2.07
FVD数据清洗 5500 万→680 万61.4 → 54.8

行为克隆上,用 Genie 的潜在动作训的智能体在 CoinRun 上只喂 200 条专家样本就能接近 100% 通关,和用真实动作的 oracle 持平,随机智能体约 0%。训练用了 256 块 TPUv5p、约 6.6×10²² FLOPs。

为什么重要

它第一次证明:只看视频、不要任何动作标签,也能学出逐帧可控的交互环境,还能把学到的潜在动作迁移到没见过的任务(行为克隆)。这对世界模型、具身智能、游戏内容生成都是基础性结果,后来 Genie 2 与 3 沿这条路继续走。潜在动作这套思路也被机器人方向拿来用,讨论里提到的「无需真实标签」正是它的卖点。

局限与存疑

自回归的通病它都有,会「编出不合理的未来」。记忆只有 16 帧,长程一致性吃力。推理大约 1 FPS,离实时交互还远。主结果算力门槛高,作者只给了一个小规模可复现案例。另外 FVD 等指标是在自建数据集上自比的,缺少与同期世界模型的统一横向对照。

术语

原文与代码

社区讨论

相关论文

全部论文解读