EXIMO: VLM Guided Exploration of VLA Policies
Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller
cs.AI
2026-08-20
DeepMind用Gemini把长程操作拆成GROD能执行的短指令,只把成功轨迹蒸回3B VLA,再加残差离策略RL。仿真Aloha的22个任务上,这条链路比给基座直接做RL更样本高效。
现在的操作策略多半是大型vision-language-action模型,在海量遥操作数据上做行为克隆。原子技能(抓、放)在分布内已经能做,但换一条要推理或把技能串起来的新指令,比如「把猴子爱吃的水果放进碗里」,成功率会掉。补数据意味着再请人遥操作几百小时;直接上强化学习,长程探索又极贵,扩散式动作头也不好用标准RL训。
Sukhija等人在Google DeepMind提出EXIMO,设定很窄:已有一个会原子技能的预训练VLA,新任务只给自然语言目标和成功检测器,不再请人遥操作。要把VLM里的常识变成VLA能执行的新技能。
三步:探索、模仿、优化。
基座是Gemini Robotics On-Device的3B版(GROD):PaliGemma视觉语言模型骨干加扩散策略头,在Aloha真机和仿真的遥操作数据上训过,吃自然语言目标。编排器是现成的Gemini。每一步VLM看到多机位图像、任务描述和历史,在思考块里分析场景,再吐一条GROD能执行的短指令。闭环跑完整条轨迹,环境的真值成功检测器只把成功回合写进缓冲区。
模仿阶段不再用VLM的子目标当条件。VLA直接以原始任务目标为条件,对成功轨迹做行为克隆,预测动作块。这样部署时不必再调VLM,也把编排器的多步行为收成一条策略。论文后来说,蒸馏后的VLA在评估时甚至超过「评估时仍挂着VLM」的版本。
优化阶段学一个残差策略:输出Δa,与VLA动作相加再执行,不去直接RL微调扩散VLA。残差条件是状态、目标和VLA动作,用MPO做离策略更新,奖励是稀疏成功指示。前置SFT如果已经有非平凡成功率,残差RL的探索会好走很多。
评测在仿真Aloha上,22个操作任务,覆盖双物体上架、语义推理(「猴子能吃的东西」)、工具盒左右格、多工具串行。原子技能在GROD训练分布内,组合、推理和左右空间关系在分布外。编排对比跑了1000个回合;RL对比在20个任务上平均,5个种子。
正文把数字画在图里,没有给出逐任务成功率表。图上的形状是清楚的:VLM编排相对裸GROD抬高成功率,长程串技能(PlateBowlOnRack)和推理变体(BananaInBowl-Reasoning)抬得最明显,成功回合的回合长度更短,采集更省。过滤后的SFT再把成功率往上推,并且超过评估时仍调用VLM的编排策略。残差RL在SFT之后继续抬成功率、缩短成功时间;给裸GROD补更多环境步以抵消探索阶段的额外数据,收敛点仍然够不到SFT+RL。若干任务上,只做VLM数据SFT就已经超过「基座+更多RL」。
附录里有两条失败对照。把VLM编排蒸进残差策略而不是GROD本体,离线能学,一转在线RL就慢于纯在线残差RL,作者归因为分布偏移。训练时按概率p混入VLM编排,评估时去掉VLM,反而不如完全不用VLM的残差RL:缓冲区里混了「纠正编排动作」和「纠正裸VLA动作」两种转移。自由句指令和只许pick/place的指令,在GROD上差不多,说明这个VLA不需要再做技能集合约束。
这是一条不请人遥操作、也能把VLM常识写进VLA的微调配方,而且评估时可以把VLM卸掉。对已经有GROD这类「听得懂自然语言的操作模型」的团队,贵的是新任务数据,不是再训一个规划器。把规划器只用在采集、把成功轨迹蒸回本体、最后用残差RL打磨,比「评估时一直挂着VLM」更适合实时控制。
样本效率的来源很具体:VLM缩短失败探索,成功过滤器提高监督质量,蒸馏后的非零成功率再给稀疏奖励RL垫底。三步缺一,图上的优势都会收。
全部结果在仿真里,没有真机数字。成功检测用环境真值,作者把VLM当成功检测器和自动复位写成未来工作;没有这项,真实闭环还是要人或者另外的奖励模型。基座GROD已经会分布内的抓放,EXIMO解决的是组合和语义,不是从零学操作。残差RL绑在扩散动作头上,换成自回归VLA要另做。22个任务仍是桌面摆放和工具入盒,没有接触力或 deformable 物体。图是主要证据,读者拿不到可引用的逐任务百分比。