冻结VLM不训机器人,一条演示把RoboTwin成功率做到73.6%

Transferring the Intelligence of VLMs to Robotic Control

Meng-Hao Guo, Zhe-Han Mo, Jia-Jun Wang, Yi Zhang, Kejin Wang, Yi-Xuan Deng, Jia-Peng Zhang, Yongming Rao, Shi-Min Hu

cs.RO

2026-09-19

清华与混元的RoboDawn把冻结VLM接到离散平移、旋转、夹爪指令上闭环控机器人。RoboTwin 2.0 C2R上GPT-6 Astra零样本53.2%、一条演示73.6%,超过全量微调的π0.5(46.0%)。

这篇在解决什么

VLA和WAM路线把预训练VLM再拿到机器人数据上训动作头。数据贵,换本体就得重采,而且有证据显示,为了拟合动作,指令跟随和推理会被冲掉。机器人数据比视觉语言语料少几个数量级,大参数更新很容易过拟合到窄分布。

RoboDawn换了提问方式:数字世界里已经长出来的多模态智能,能不能只靠一层人能看懂的动作接口,加几条上下文演示,直接搬到物理控制上,参数完全冻结。

方法

接口故意做成游戏手柄那种语义原语,关节角和高频连续末端位姿都不直接让模型出。夹爪交互点(GIP)取两指尖中点,平移、旋转、开合都相对这个点来定义,避免手腕位姿和真正接触点对不上。

指令集合很短:

每条语义指令会被展开成完整规划轨迹,执行到静止再返回观测。VLM每轮看到多视角图像、机器人状态、上一轮执行反馈和记忆,输出动作序列加一段结构化草稿(进度、当前计划、便签)。

上下文演示拆成两层。共享的命令primer展示每条原语会怎么改画面;任务级演示把专家轨迹先压成末端路点,再翻译成模型自己会发出的语义命令。仿真用脚本专家,真机用遥操作。长程任务把图像预算卡在每轮16张,只保留抓取、旋转、完成这类语义帧。

结果

RoboTwin 2.0 C2R共50个双臂任务。基线按官方协议用每任务50条干净演示联合后训练,评测在域随机化场景。RoboDawn不更新参数,演示只进上下文。

方法数据成功率
π0.5全量后训练46.0%
LingBot-VLA全量后训练50.4%
HarnessVLA(Claude Code)全量后训练58.4%
RoboDawn GPT-6 Astra零样本53.2%
RoboDawn GPT-6 Astra一条演示73.6%

一条演示已经比HarnessVLA高15.2个百分点。Gemini-3.8-Flash从零样本47.0%到1-shot 62.2%、4-shot 65.4%,8-shot掉回62.7%,上下文太长会帮倒忙。1-shot下模型能力差一档就差一截:GPT-5.6-Luna 14.4%,GPT-5.6-Sol 43.2%,Seed-2.1-Pro 45.0%,Gemini-3.8-Flash 62.2%,GPT-6 Astra 73.6%。

零样本拆掉推理掉到34.8%,拆掉网格定位掉到32.4%,拆掉命令primer只掉到44.0%。网格和推理比primer更关键。

RoboDojo 42个任务、5次平均:零样本成功率35.67%、进度分39.92;1-shot 47.17%、54.63。全量后训练的DM0.5只有19.34%。命令预算从60提到240,1-shot从31.2%到47.2%,测试时多走几步确实能换成功率。

真机零样本、Gemini 3.8 Flash:Franka放块进篮9/10,堆叠5/10,Piper折布0/10。折布失败主要卡在末端旋转,论文猜测网页预训练里这类三维朝向例子更少。

代价也清楚。用Seed-2.1-Pro测延迟,单轮推理9.74秒、3.4条命令、运动2.09秒,推理/运动比4.65。π0.5是101毫秒推理、I/M 0.037。这套接口换来的是决策,不是高频伺服。

为什么重要

对想上通用操作的人,这意味着「先堆机器人数据再训VLA」不是唯一路径。只要动作空间被翻译成VLM已经见过的空间原语,现成的闭源多模态模型可以当高层决策引擎,低层规划仍交给传统控制器。一条演示带来的跳变,也说明接口对齐比再采2500条演示更划算。

这是渐进方案,替代不了精细插入和高速力控。适合桌面级、允许秒级思考的操作,不适合需要100Hz的力反馈。

局限与存疑

论文自己列了四条:推理慢,转比重难,接触附近离散步长太粗,错误动作会撞东西。失败案例也对得上:硬币入储蓄罐插不进,麻将杠牌时IK撞桌,倒液体提前喊done。

对照并不完全公平。π0.5等基线在域随机化上评测,但它们吃的是干净场景的50条演示训练;RoboDawn的1-shot演示也来自干净集。零样本已经超过π0.5,这条还站得住。真机只有三个任务、每个10次,折布0/10被解释成「朝向数据少」,没有单独的旋转专项消融来钉死这个解释。GPT-6 Astra、Gemini-3.8-Flash都是闭源API,复现成本在调用费和延迟,不在权重。

术语

原文与代码

相关论文

全部论文解读