In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks
Minxing Li, Minghao Han, Weizhi Zhao, Hanwen Wang, Xiangshuo Liu, Shuyao Shang, Jingxiang Zhou, Mingchao Sun, Hongyu Pan, Mu Xu, Yu Liu, Lue Fan, Zhaoxiang Zhang
cs.RO
2026-09-30
SimpleICL把人类视频里该跟的内容定为动作、物体、顺序和可供性,并用跨组配对降低采集成本。八个未见真机任务的难设置成功率68%,Fast-WAM为42%,π0.5为31%。
机器人看一段人的操作视频就做新任务,不必再采遥操作、再微调。HOST、GEN 1.5、Zero-WAM 已有初步的零样本结果。视频把轨迹、物体、抓取部位、顺序和目标叠在一起。
物体挪开后,照抄路径会抓空。只追最终状态,又会漏掉顺序,还有杯把和杯身的差别。短指令补不上,图 1 只有一句 Put the tea bag into the cup。要写清必须跟什么,以及必须丢掉什么。
SimpleICL 由中科院自动化所与高德提出。
必须跟四类。动作是类别:抓、放、转、按、平移,不复刻关节曲线。物体看当前位姿,不看示范里的绝对坐标。顺序算进任务,先香蕉后苹果不同于反过来。可供性要分出抓杯身还是抓杯把。
必须丢三类。普通的位置差可以变。极端错位被当成另一种语义,论文没给距离阈值。人的速度、臂型、外观、抓取角度和伸手习惯要忽略。光照、背景和无关杂物也要忽略。
数据按这个边界造。同一场景里同时有「按压皂液器」和「抓起皂液器放到托盘」。物体位置会扰动,旁边有别的物体,每个场景只有一个目标实例。同一组动作采集不同先后。可供性遵守人机一致:同一对数据里手和夹爪抓同一处,下一对再换成杯把或杯身。
不变性来自增广。示范者包括裸手、彩色手套和不同肤色,同一条机器人轨迹配上不同光照、色温和机位。采集按组,一组是一个场景加上其中的任务。大切换更换整场,小切换只改布局、灯光或干扰物,然后把人类视频和机器人轨迹交叉重配。单台机器人一个工作日最多约 3000 条有效配对。
骨干用 Wan2.2-5B。沿 Fast-WAM 插值出 1B 动作 DiT,地平线 32,与视频 DiT 以 MoT 相连。128 个 query token 加 4 层交叉注意力,隐层 3072,约 0.6B 参数,把示范压成定长后送入两侧上下文。上下文里已经有文本和状态。视频 DiT 用 LoRA,其余全参训练,多相机画面拼成一张图。
仿真在 RoboTwin 2.0 上做。原生数据常把无关物体放在工作区外面。ICL 向数据 18000 条,原生对照 27500 条。语义区分的平均成功率:Fast-WAM 用原生数据 37.6%,SimpleICL 用原生数据 40.3%,换上 ICL 向数据为 72.1%。去掉视频条件还剩 61.6%,去掉未来预测掉到 20.2%。
七个未见任务的平均成功率:Fast-WAM 24.6%,SimpleICL 65.9%,无视频条件 26.3%,无未来预测 17.9%。没有视频时,新任务回到基线附近。去掉未来预测后,两项测试都垮。仿真里示范和执行都用 AGILE X,没有人手到夹爪这一跳。
真机是 Franka,三台 RealSense D435,遥操作用 SpaceMouse。八个任务没进训练集,海绵、盘子、抽屉、水果、碗、架上物品、皂液器和目标茶杯也没有。Easy 是唯一任务、唯一做法;Medium 是同一画面里有多件任务;Hard 是同一任务有多种合法做法,例如两只相邻的盘子,必须擦示范里的那一只。表 3 以小数书写成功率,下文写成百分数。
| 难度 | SimpleICL | Fast-WAM | π0.5 |
| Easy 平均 | 81% | 80% | 72% |
| Medium 平均 | 70% | 65% | 47% |
| Hard 平均 | 68% | 42% | 31% |
Easy 平均只高出 Fast-WAM 1 个点。擦盘子为 77%,低于 π0.5 的 97% 和 Fast-WAM 的 87%。倒茶为 73%,低于 83% 和 80%。Hard 八项都更高:筷子 77% 对 27% 和 10%,倒茶 57% 对 27% 和 20%。
意图跟随率在带判别采集时平均 89%,去掉后为 75%。组合顺序不怎么依赖这组设计:零食、杯子、袋子去掉后仍是 93%、97%、93%,保留时是 97%、100%、90%。可供性很依赖显式的两种抓法:带把杯子 87% 对 60%,卷尺 77% 对 40%,胶带 83% 对 47%。动作居中,纸巾从 83% 降到 67%,筷子为 93% 对 97%。
原设置 81%,物体移位 79%,换外观 77%,换人和风格 80%,改光照 78%,改背景 79%,加杂物 75%。拿掉跨组配对后,原设置仍是 80%,移位降到 51%,杂物 66%,背景 71%,策略改去够示范视频里的那个坐标。
能复用的是分组采集和交叉配对,数据和训练流程准备开源。画面里只有一件事时,Fast-WAM 已经到 80%,这里只多 1 个点。多任务叠在同一画面时,Hard 拉开到 68% 对 42% 和 31%。短语言还在上下文里,视频补的是物体、顺序和抓法。结构上是渐进改动:Wan2.2-5B,外加 1B 动作 DiT 和 0.6B 的 query。
HOST、GEN 1.5、Zero-WAM 没有放进对照。Hard 上对 Fast-WAM 和 π0.5 的领先,有一部分是因为这两条基线没有视频条件。两条基线在真机上用哪套数据训练,论文没有写清。仿真两侧都是 AGILE X。人手和夹爪的差别只在一台 Franka、八个任务上测过,成功率没有误差条,每格做了多少次也没写。
训练假定一个场景里同一目标物只有一个。两只一样的杯子该跟哪只,不在这份定义里。极端移位算作新语义,距离阈值没测。速度和特定接近角度被主动丢掉。可供性不会自己出现,同一物体得采集两种抓法,不然跟随率掉到 40% 至 60%。人机一致还规定每一对里手和夹爪抓同一个点。Easy 的擦盘子和倒茶低于至少一条基线,这和图 1 的八项都最好并不一致。