0.9B 机器人策略追平 7B:在策略自己的表征空间里预测未来

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

cs.RO, cs.CV

2026-08-03

SG-WAM 把世界模型塞进 0.9B 机器人策略,用策略自身的 EMA 副本当未来预测目标并叠几何监督,LIBERO 拿 98.5%、零样本泛化 73%,追平一众 7B 模型。

这篇在解决什么

机器人操作策略(让机械臂抓取、摆放、折叠物品)现在流行一类叫「世界动作模型」(World Action Model,WAM)的架构:它不只输出动作,还顺手预测「做了这个动作之后场景会变成什么样」。这种预测未来的监督,能逼着策略学到动作如何改变环境,而不只是死记示范轨迹。

但现有 WAM 在「往哪个空间里预测未来」上分成两派,各有硬伤。一派直接预测未来的图像、视频或深度图,监督信号很密,但模型被迫去重建纹理、光照、背景这些跟操作成败关系不大的东西,算力浪费在「画得像」上。另一派改在隐空间里预测,省了重建的开销,但用来定义「未来应该是什么」的目标表征,往往来自一个外部编码器或预训练特征空间,跟真正生成动作的那个策略表征不是一回事。于是预测目标和动作专家之间存在错位:模型费力学到的东西,未必是动作需要的。论文要解决的,就是怎么造一个既跟动作生成同源、又保留操作所需空间几何信息的未来预测空间。

方法

SG-WAM 把三件事缝在一个 0.9B 的 VLM(Qwen3.5-0.8B)里端到端一起训。

一是自引导世界建模。模型在视觉和语言 token 序列里插入若干「可学习的动态 token」(dynamics token),由一个「自引导世界预测器」根据当前策略状态和一段中间动作,预测这些 token 的未来隐状态。关键在于预测目标的构造:它不是另开一个编码器去编码未来观测,而是把未来观测喂给同一套策略骨干的指数移动平均(EMA)副本,让这个慢更新的副本产出目标。这就保证了预测的空间和动作专家用的空间是同一族表征,不存在错位。这套 EMA 自监督的思路,跟 BYOL、DINO 那一类自监督学习是一脉的。

二是几何监督。光跟动作同源还不够,操作任务需要细粒度的空间信息(东西在哪儿、怎么被抓)。训练时用一个冻结的 3D 几何基础模型 VGGT 当老师,用余弦相似度把主视角图像 token 的表征往几何特征上靠。注意这个几何老师只负责塑造视觉上下文,并不定义未来预测的目标,动态 token 的目标始终来自 EMA 策略本身。

三是流匹配动作专家,直接拿包含动态 token 的完整上下文生成连续动作块。

三个目标(动作、几何、未来预测)一起优化。推理时,几何老师、世界预测器分支、EMA 目标通路全部删掉,只留在线 VLM、动态 token 和动作专家。世界建模是纯训练期的辅助,推理不增成本。

结果

仿真基准 LIBERO 的四个任务套平均成功率 98.5%,和最强的 Spatial Forcing(7B)并列第一,但 SG-WAM 只有 0.9B,而且没有用大规模具身预训练。

方法参数量具身预训练LIBERO 平均
OpenVLA-OFT7B97.1%
π03.3B94.4%
Fast-WAM6B97.6%
VLA-JEPA2B96.1%
Spatial Forcing7B98.5%
SG-WAM0.9B98.5%

零样本泛化更能说明问题。LIBERO-Plus 在相机视角、机器人本体、语言、光照、背景、噪声、布局七个维度上施加扰动,SG-WAM 总体 73.0%,全场最高;在相机、语言、光照、布局四类扰动下都是第一。那些在标准 LIBERO 上很强的方法(Spatial Forcing、Fast-WAM)一到分布外就掉得明显。

真实世界(UR5e 机械臂,三个任务)上,SG-WAM 在分布内和分布外都赢了显式派 VPP 和隐式派 VLA-JEPA。消融显示,去掉世界建模掉 1.9 个百分点(长程任务 LIBERO-Long 掉得最多,96.2% 降到 92.2%),去掉几何监督掉 0.9 个点,两者互补。动态 token 数量从 1 增到 8 时成功率上升(96.1% 到 98.5%),到 16 反而回落(97.2%),说明够用就行,不是越多越好。

为什么重要

这篇给出的信号很直接:要拿到顶尖的操作策略,不一定要堆到 7B、不一定要烧大规模具身预训练。把预测未来这件事放到策略自己用的表征空间里做,再用几何把空间信息钉进去,0.9B 就能追平大模型,而且泛化更稳。对做机器人的从业者,这意味着更小的部署模型、更低的训练数据门槛。EMA 自监督这一手也提醒大家:之前隐式 WAM 的目标与策略错位,其实有现成的自监督工具可以绕开。

诚实讲,这是在 LIBERO 这套已经偏饱和的仿真基准上的渐进推进,98.5% 这种数字本身不再是瓶颈;真正的看点是它在分布外和真实世界里相对大模型的优势,以及「小模型加好结构」这条路线的可行性。

局限与存疑

作者承认:目前只在单一本体(UR5e)上验证,未来要扩展到更大骨干和跨本体数据集。真实世界只测了三个任务,样本量也小(取放、折毛巾各 20 次,工具箱整理 10 次)。绝对成功率并不都漂亮,折毛巾分布内只有 45%,换新物体时各任务普遍掉到 25% 到 40%,真正的新物体泛化仍然是硬骨头。

另有一点:0.9B 对 7B 的比较不完全公平,很多 7B 基线吃了大规模具身预训练的红利,而 SG-WAM 没有。这恰恰是它的卖点,但也意味着没法直接说「结构优于规模」,只能说在没预训练的前提下,结构能弥补规模。另外 LIBERO-Plus 仍是仿真,真实世界的分布外只覆盖了背景、光照、新物体三种扰动,离开放场景还远。

术语

原文与代码

相关论文

全部论文解读