港大四级模仿基准:功能替换处成功率从 0.42 掉到 0.29

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

cs.RO, cs.AI

2026-08-23

港大把机器人看人视频模仿拆成四级。九个模型在仿真与真机上 L0–L2 还能跟,L3 功能替换成功率从约 0.42 掉到 0.29;未见任务零样本全低于 13%。

这篇在解决什么

人看别人搅汤,学的是「把汤搅匀」这件事。勺子换成筷子、锅挪了位置,手还能接得上。机器人从人类视频学操作,多数还在做轨迹重映射:把手部关键点或光流抠出来,对齐到机械臂,再在几乎同一套场景里重放。场景一变,演示过的动作就废了,任务本身其实没变。

现有泛化基准(COLOSSEUM、RoboTwin 2.0、REALM)测的是训练场景被扰动之后还能不能做;Vid2Robot 这类视频条件策略也多在分布内测。港大(The University of Hong Kong,联署 TranscEngram、复旦、浙大)把问题换成:机器人看一段人类演示视频,能不能在自己那套、可能差得很远的场景里把意图做出来。这决定了网上那些海量人类视频,能不能当真变成机械臂的监督信号。

方法

Imitator Game 把演示场景和执行场景的差距拆成四级,每一级只改一类东西:

策略输入只有演示视频 V 和当前观测,没有任务描述,也不被告知这一集是第几级。语言条件 VLA 走平台侧固定 captioner(人工标注加 Qwen3-VL,写清意图、布局、双臂子任务序列),视频条件模型直接看视频。

配套三件套。IG-10K:2 万+ 配对 episode(真机 1.17 万对,仿真 1 万对),50+ 基础任务、200+ 变体、6 个场景域。真机是双臂 Realman 的 VR 遥操作,仿真是 ManiSkill3 里的双臂 Franka。每条带多视角、3D MANO 手姿、分割掩码、三档语言标注。每个任务-级别目前只配一种替换模式,监督量对齐。Imitator Arena:仿真用目标谓词打 SR / Sub-SR;真机和仿真都走盲评 A/B。10 名志愿者,仿真 1.5 万对、真机 5 千对比较。九个模型、十五个训练变体覆盖三类接口:VLA(OpenVLA、RDT-1B、GR00T-N1.6、π0.5)、技能检索(XSkill、UniSkill)、视觉-动作(ACT / Diffusion Policy / VQ-BeT,编码器 DINOv2、SigLIP2 或 VideoMAE)。骨干冻结,只训动作头。

预训练语料嵌套 15 / 30 / 45 个任务、每任务 50 条。评测 5 个 seen(搅汤、叠毛巾、挂杯子这类长程或灵巧)加 5 个 unseen 原子技能,四级全测。未见任务三种设定:零样本、从零 10 条、预训练后再用 10 条微调。

结果

仿真 seen 任务上,视频条件管线更强。

方法Seen SRSeen Sub-SR零样本 SR从零 10 条 SR预训练+微调 SR
ACT/DINOv20.810.930.020.760.84
XSkill0.790.910.100.350.73
π0.50.730.890.090.800.85
OpenVLA0.290.600.060.140.20

零样本上限是 VQ-BeT/DINOv2 的 0.13,九个模型全低于 13%。预训练帮的是少样本适配:15 个仿真变体里 12 个预训练+微调超过从零;语料从 15 任务扩到 45 任务,14/15 变体上升。GR00T 的 Δ 最大(+0.46 SR),RDT-1B 和 VQ-BeT/DINOv2 反而掉。

真机 Arena(人判成功)上 XSkill 最稳:seen 0.63、零样本 0.29、预训练+微调 0.49,盲评胜率 seen 0.89、微调后 0.95。π0.5 在 seen 上 0.51,零样本掉到 0.04,扩语料也抬不起来;三个视频条件模型的真机零样本随语料单调升(XSkill 0.24→0.33)。

难度真正翻脸在 L3。真机预训练+微调的四级平均成功率:

级别平均 SR平均模仿分 Q(0–10)
L00.426.26
L10.426.22
L20.396.17
L30.295.62

XSkill 在 L0–L2 还能维持 0.53–0.57,L3 直接掉到 0.29。布局换了、同类物体换了,现有策略还能跟;要换一套用法完成同一意图,跟不上。仿真侧 L2 反而更难:仿真 L2 还故意换了操作臂,加上资产池有限、轨迹是规则规划,L3 替换物体常常还能用训练过的抓放套路蒙过去。真机没有这条捷径。

为什么重要

这篇把「从人类视频学操作」从一句口号拆成可测的梯子。网上视频要能当机器人数据,卡点不在摆放扰动,在功能替换。只在近似场景里重放轨迹,L0–L2 的数字会看起来还行;拿 L3 一测,intent 接口还没建起来。

把语料或动作头做大,intent-level 模仿不会顺便出现。该做的是让演示视频继续当「目的」的证据:affordance 感知的物体 grounding、显式目标推断、能扛住物体替换的中间表示。IG-10K、Arena 和 L0–L3 协议都开源了。

配对人类-机器人数据对少样本微调有用,对零样本几乎没用。视频条件接口比 caption 条件更能把规模变成迁移。骨干冻结、只训动作头,是为了公平比接口,不是声称这是最优训练配方。

局限与存疑

数据集是人工设计的有限集合。每个任务-级别只有一种替换,量了可比性,没量替换方差;层级改的是场景差,人形到机械臂的 embodiment 差基本固定。仿真 L3 被有限资产和规划轨迹带偏。评测的九个模型都是接到这个接口上的现成策略,不是为意图模仿专门设计的。

真机每组 task-level 只跑 5 次、仿真 10 次,L3 那 0.13 的落差在小样本上会抖。人工评测每个屏幕只有一名评委,靠重复抽样而不是双人一致性,论文也没报评委间一致性。VLA 的 caption 是人工核过的稠密描述,比真实部署里自动生成的 caption 更友好,语言条件模型在这篇里可能被抬了一截。冻结骨干等于没让大模型用配对数据改视觉表征,intent 缺口有多少来自接口不行、有多少来自表征没训,这篇分不开。

失败模式也偏接触层:薄勺子搅汤抓不住、垃圾袋双臂协调、挂杯子高度对不齐。L3 掉点里,有多少是意图没推断出来,有多少是换物体之后抓取标定崩了,没有拆开。

术语

原文与代码

社区讨论

相关论文

全部论文解读