Dreamer 4纯离线拿到钻石,数据量只及VPT百分之一

Training Agents Inside of Scalable World Models

Danijar Hafner, Wilson Yan, Timothy Lillicrap

cs.AI, cs.LG, cs.RO, stat.ML

2025-09-29

在2B世界模型里做想象训练,Dreamer 4成为首个纯离线拿到Minecraft钻石的agent,钻石成功率0.7%,铁镐29%,数据量约为VPT的百分之一。

这篇在解决什么

世界模型本应让 agent 在想象里练策略,避开真机上不安全、很慢的试错。前几代 Dreamer 在窄环境里又快又准,但容量撑不住复杂交互。Genie 3 这类可控视频模型能出多样场景,却学不准物体物理和游戏机制,还常常要好多块 GPU 才能实时滚一步。

Minecraft 钻石是一条超过 2 万步键鼠操作的长程任务。有经验的玩家平均约 20 分钟。VPT 靠 2.5K 小时承包商数据去标注 27 万小时 YouTube,再加 19.4 万小时在线 RL 才拿到钻石。许多落地场景不允许把半成品策略丢进真环境。这篇把目标收成:只用离线数据,从像素和键鼠拿到钻石。

方法

Dreamer 4 分三阶段。先训因果 tokenizer(掩码自编码,MSE+LPIPS)和动力学模型;再插入任务 token,用长度 8 的多 token 预测学行为和奖励;最后冻结 Transformer,只在想象轨迹上用 PMPO 更新策略和价值头。

动力学的核心是 shortcut forcing。它把 diffusion forcing 的逐步去噪和 shortcut model 的步长条件拼在一起,每帧 4 次前向就能出表示。网络预测干净表示(x-prediction)而不是速度,减轻逐帧滚动时的高频误差累积。损失按信号水平线性加权,让模型把容量花在信息多的噪声档上。历史帧会加一点噪声(τ=0.1),对自身生成的瑕疵更稳。

架构是块因果 Transformer:空间注意力和每 4 层一次的时间注意力分开,GQA 压缩 KV cache。Tokenizer 约 400M,动力学约 1.6B。Minecraft 用 VPT 承包商数据 2541 小时、360p、20 FPS。键鼠分别做成 23 维二值和 121 类注视离散化。行为克隆只打在「完成了某任务」的片段上,动力学损失打在均匀片段上,避免想象过于乐观。

结果

评测是 60 分钟一局、随机世界、空背包,1000 局。VPT(微调)最高常到木棍,成功率约 53%。Gemma 3 做 VLA 行为克隆,铁镐成功率 11%。Dreamer 4 在石镐及更早里程碑上超过 90%,铁镐 29%,钻石 0.7%。想象 RL 相对纯行为克隆的增益,随里程碑变难而变大,到达时间也更短。世界模型表示做 BC,比 Gemma 3 通用视觉表示更强。

人在世界模型里用键鼠做 16 项交互:Dreamer 4 完成 14/16,Oasis large 5/16,Lucid-v1 0/16。上下文 9.6 秒,约是前作的 6 倍,单卡 H100 约 21 FPS,对得上游戏 20 FPS。

动作数据可以很少。2541 小时视频里只配 100 小时动作,动作条件生成就能达到全动作模型 85% 的 PSNR 和 100% 的 SSIM;10 小时则是 53% / 75%。只在主世界看过动作、下界和末地只看无动作视频时,动作条件仍能外推。消融从表 2 的 diffusion forcing 出发,FVD 从 306 降到 57,推理从 0.8 FPS 提到约 21 FPS。

为什么重要

这是目前最接近「离线世界模型 + 想象 RL」能打长程像素控制的一份配方。对机器人这种在线试错贵且危险的领域,故事很清楚:大部分知识可以来自无动作视频,动作标签只需一小段,策略改进可以完全发生在模型里。

钻石成功率 0.7%,按绝对值很低。它的意义是「这条离线设定里别人是 0」。石镐 90%、铁镐 29% 说明前半程已经可用,钻石仍是尾部事件。

局限与存疑

世界模型远不是游戏克隆:记忆只有约 9.6 秒,物品栏显示经常发糊或中途换物品。16 项交互里仍有 2 项失败。钻石 0.7% 离人类 20 分钟常规通关还很远,论文也没给出和在线 Dreamer 3、VPT-RL 的同设定对比,因为动作空间和是否在线都不同。想象 RL 优化的是学到的奖励模型,奖励模型偏了,策略会跟着刷假进度。训练用 256 到 1024 块 TPU-v5p,复现门槛高。真实机器人只展示了反事实生成,没有在真机上交策略。

术语

原文与代码

社区讨论

相关论文

全部论文解读