每步融成一个world token,85M从零在23项任务上拿到59.45%

WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning

Chunkai Yang, Andong Yang, Chao Gao

cs.RO

2026-08-24

WorldToken把每步多视角、本体和任务条件融成一个world token,再用因果Transformer加扩散动作头。85.3M从零、每任务2900条演示,23项RoboCasa闭环成功率59.45%。作者没证明这种组织优于其他切法。

这篇在解决什么

机器人策略在往「把交互写成序列、用 Transformer 做模仿」靠,序列的基本单元却没有共识。有的把一帧拆成一堆视觉 token(RT-1),有的把状态和动作交错(ICRT),有的把语言、图像、未来帧预测塞进同一条 GPT 流(GR-1)。时间都在,顶层位置的含义却不一样:有的是模态,有的是空间块,有的是生成角色。

WorldToken 把物理时间、也就是一次观察–决策–再规划,定为顶层序列的单位。一步里的多相机、本体感觉、任务条件先在步内融掉,再交给时间建模。序列长度等于决策次数,不跟每步的 patch 数走。

方法

三截流水线。步内编码器把当前观测压成 zt。视觉 stem 出 patch,和本体、任务条件投影到同一宽度,拼上 4 个可学习 readout token;readout 可以看所有观测 token,观测 token 不看 readout。拼起来经 RMSNorm 和线性层得到唯一的 world token。RoboCasa 输入是三路 128×128 RGB、16 维本体、冻结 CLIP 的 768 维任务嵌入。

时间骨干是按 Qwen2 decoder 从零初始化的因果 Transformer,沿 world token 序列用一维 RoPE。动作头只读当前步的 ht,更早的观察必须先经过因果注意力才能影响当前动作。默认序列里没有历史动作 token,动作效果靠后续图像和本体回流。上下文长度 C 满了就滑窗,滑窗后相对位置几何保持不变。

动作头是 DiT 扩散,预测 H=10 步、12 维指令,执行前 Hexec=4 步再重规划。环境控制 20 Hz,每 4 个控制步做一次决策,相当于 5 Hz。训练只监督动作,没有未来观测预测。参数统计含卷积视觉 stem,不含冻结 CLIP。

结果

23 项 RoboCasa 家务操作,数据规模 {50, 100, 300, 1000, 2900} 条/任务,模型 {44.3M, 85.3M, 218.8M, 648.9M, 1.49B},两颗训练种子,共 50 个策略。每策略三次官方 seen/unseen 评测,每任务 50 回合,合计 172500 条闭环。

设置成功率
BC-Transformer,300 条/任务31.28%
WorldToken 85.3M,300 条/任务46.83%
WorldToken 85.3M,2900 条/任务59.45%
WorldToken 218.8M,2900 条/任务60.26%

每任务 300 条生成演示时,85.3M 比同设置复现的 BC-Transformer 高出 12–16 个百分点。2900 条时单次最好 62.0%。已发表、带十亿级预训练的 RoboCasa 系统大约 50–79%,多数在 58–70%;数据、初始化和汇报口径都不同,只能当量级参照。

数据从 50 加到 2900,五档模型的 holdout RMSE 降 47.0–56.8%,成功率升 32.7–39.3 个百分点;相邻四次加数据,40 组对比里两项指标全部变好。1000 到 2900 时 RMSE 还降 17.10%,成功率只再升 3.39 个百分点,闭环成功率更早走平。模型从 44.3M 到 218.8M 稳降 RMSE,再往上的 648.9M 和 1.49B 不再稳定更好。

把训练时 C=10 的 50 个策略在推理时截到 1 或 2 步,成功率全部下降,最小降幅分别是 3.5 和 1.4 个百分点;截到 5 步时 47/50 个策略离满上下文不到 2 个百分点。另训短上下文策略能把大部分损失找回来:C=10 的策略在 Ctest=1 时大约 28%,从零按 C=1 训练能到 46.75% 和 47.68%。历史依赖主要是适应训练上下文,不是任务非那么长不可。

RMBench Blocks Ranking 上,同一 checkpoint、100 个初始条件,可见历史从 608 个 world token(约 146 秒)收到 32 个(约 8 秒),评估器成功率从 95% 到 28%。单次交换的 24 条在所有 C 下全过;多步交换才拉开。探索性加长 rollout 里,有一条完成 31 次正确顺序交换,最后一次正确交换在 856.44 秒,演示最长只有 5 次交换。

为什么重要

对做 VLA 和模仿学习的人,这篇的价值主要是把「一步一个 token」写成可扫规模、可切上下文的完整实例,并把边界写清楚。85M、只冻 CLIP 文本编码器、目标域数据堆到 2900 条/任务,就能走进带预训练的十亿级系统常报的成功率区间。规模扫描给出很具体的配方:先加目标域数据,模型容量过 200M 收益变薄。

作者反复强调,这不证明 time-first 优于其他切序列方式,也没有把编码器、时间骨干、扩散头拆开归因。当接口看可以,当 SOTA 声明看不行。

局限与存疑

局限节写得很干脆。证据停在仿真和纯动作模仿;主扫描只在这一族 WorldToken 里;长上下文证据集中在 Blocks Ranking 一个任务;没有在匹配条件下对比其他序列组织,也没有真机、显式动作历史、预测目标和系统效率。公开对照表协议不对齐。离线 RMSE 和闭环成功率在上下文长度实验里会分叉:更长上下文把专家轨迹拟合得更好,闭环不一定更高,匹配训练时 C=5 的闭环最好。生成演示、固定最后 checkpoint、不做 rollout 选点,和很多预训练工作的汇报方式不同。

术语

原文与代码

相关论文

全部论文解读