Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos
Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou
cs.RO
2026-06-23
NUS Show Lab 的 GRA 从人手视频抽出 2D 末端路标监督 VLA 视觉骨干,action 只吃 25 条真示教加 75 条合成视频。三任务闭环 68.9%,比伪动作基线高 14.5 到 20 点。
VLA 同时看图、听指令、出电机动作,训练要成对的视频和动作。真人遥操作贵:一台 Franka、训练过的操作员、每条轨迹都得现场采。人手操作视频到处都是,人到机器人的视频生成已经能批量合成机器人执行画面。这篇用 Wan 2.2,按 Mitty 的 LoRA 配方微调。生成器只造像素,不造物理动作。
主流做法把合成视频当成缺了标签的示教:用逆动力学模型(DreamGen 一类)或几何重定向(MimicDreamer 一类)从生成帧里反推伪动作,再塞进 VLA 的 action head。视频生成优化的是画面像不像,不是控制律对不对。把幻觉像素硬映射成真实电机指令,等于让 action head 学一套被生成器扭曲过的控制。
这篇的判断更干净。视频里活下来的是几何:末端往哪走、物体怎么摆。控制信号在生成过程里丢了。监督该跟活下来的东西走。
GRA,Geometry-guided Representation Alignment。基座是 OpenVLA-OFT:视觉骨干把图投到 Llama-2 7B 的嵌入空间,连续 L1 回归头输出 24 步的 7 维 delta 动作(平移、滚转俯仰偏航、夹爪)。几何监督走另一条路。
2D 路标不从生成像素里抠,从源人手视频里算:
生成机器人帧和路标按源视频的帧号对齐,但来源分开。监督信号不经过生成器,这是整套设计的核心。
训练分两段。Stage 1 跑 5K step:只训视觉骨干(LoRA rank 32)加一个三层 MLP 的 2D 头,在合成帧上回归未来路标。语言模型和 action head 不进前向。Stage 2 跑 10K step:合成帧退出。action head 只在 25 条真人示教上做 L1。Stage 1 的 2D 头继续用真实帧上的本体感受投影当锚,权重 λ=0.5,防止 action 梯度把空间结构冲掉。单卡 H200,batch 16,学习率 5×10⁻⁴。
实验在 Franka Research 3 上,固定 RealSense D435,三个桌面抓放:方块放到垫上、杯子放到杯托、芒果放到盘子,各 30 次。匹配预算每任务 25 条真示教加 75 条生成视频。上限参照是 100 条真示教、不用合成数据。成功由同一名实验员目测,碰到目标滑掉或夹爪提前张开记失败。控制 10 Hz,超时 30 秒。
| 方法 | 方块→垫 | 杯子→杯托 | 芒果→盘子 | 三任务均值 |
| Real-only(100 条) | 73.3% | 63.3% | 90.0% | 75.6% |
| Real-only(25 条) | 60.0% | 46.7% | 76.7% | 61.1% |
| DreamGen-style | 46.7% | 36.7% | 63.3% | 48.9% |
| MimicDreamer-style | 53.3% | 40.0% | 70.0% | 54.4% |
| GRA | 66.7% | 56.7% | 83.3% | 68.9% |
GRA 比同预算 Real-only 高 7.8 点,把跟 100 条真示教的差距从 14.5 点收到 6.7 点,真数据用量是四分之一。两条伪动作基线全部掉到 Real-only 下面:DreamGen-style 低 12.2 点,MimicDreamer-style 低 6.7 点。三个任务方向一致。
诊断把不对称钉死了。现成 SigLIP 上,路标探针误差 0.14σ,delta 动作 0.63σ,空间信息大约好抠 4 倍。合成域训、真实域测:路标 0.41σ,delta 动作 1.38σ。Stage 1 路标预训练把域内路标误差压到 0.10σ,同时把 delta 动作误差抬到 0.82σ。监督路由会改骨干里什么信息还读得出来。
逐步动作误差用 teacher-forcing,喂真实观测、不算闭环累积。GRA 位置误差 9.26 mm、总 L1 0.060;Real-only 是 11.09 mm / 0.090;MimicDreamer-style 是 13.36 mm。空间探针上 GRA 和 MimicDreamer-style 并列,L1 都是 0.020,但闭环 MimicDreamer 低 14.5 点。骨干空间读得出,不等于控制干净。
消融只做最难的杯子任务:完整 GRA 56.7%;去掉 Stage 1 剩 43.3%;去掉 Stage 2 锚点 46.7%;把路标换成重定向的 delta 动作 36.7%,比 Real-only 的 46.7% 还差。三条都在干活,换监督内容比换路由更伤。
合成机器人视频正在变成 VLA 的数据补丁。默认动作是生成画面、反推动作、当真示教用。这篇给了一个反例:在这个设置里,伪动作不但没帮上忙,还把控制策略拉下去十几个点。
能用的场景很具体。已经有一点真人示教(这篇是每任务 25 条),再有人到机器人的生成视频。几何监督给视觉骨干,控制仍靠真数据。单卡 H200 就能跑完两阶段。
这是路由上的改进,不是生成器或基座模型的突破。闭环天花板仍绑在真动作数据规模上。作者自己也这么写。
作者承认两头。上游的空间-控制不对称是经验观察,没跨生成器系统刻画,「活下来的」会不会超出几何也没答。下游闭环还是跟着真动作数据走,要抬天花板得等生成器或动作解码器能给出可信控制信号。
实验面更窄。三个桌面抓放、一台 Franka、一只固定第三人称相机、每任务 30 次、成功由同一名实验员目测。目测本身不可复现。伪动作基线是 style 复现,不是原论文官方实现。DreamGen 那条的 IDM 用真实示教训、再打到生成帧上,本身就把域差写进了标签。
路标管线也有误差。Stage 1 留出视频上未来 8 步路标 MAE 约 18.5–23.2 像素,相当于图像宽度的 3.8–4.8%。几何监督不是干净标签,只是比从生成像素反推控制更稳。