CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
Junlan Xiao, Junwei Jiang, Zaibin Zhang, Yifan Wang, Zhongbo Zhang, Huchuan Lu, Lijun Wang
cs.RO
2026-09-21
大连理工把VLA失败拟合成阶段条件偏差分布再合成纠偏示范,推理时用3D点云监控触发原子级调整或重做。π0在RoboTwin难任务上从39.6%升到60.7%,真机平均涨15.9点。
Vision-Language-Action(VLA)策略在名义轨迹上已经能做不少双臂操作,一旦物体打滑、放偏、两只胳膊不同步,策略就进了训练里几乎没见过的状态。现有补救两条路:检测失败后回滚重规划,或者在随机扰动附近采集纠偏示范。前者把失败当要清掉的异常,后者的扰动往往对不上这条策略真正会犯的错。
大连理工大学问的是另一件事:执行失败本身能不能变成纠偏监督。
CARE 分两段。第一段从失败里学该补什么数据。先跑 100 条不带纠偏的名义原子计划,记下每个原子阶段不满足终止条件时的几何偏差:抓取看夹爪闭合时物体相对夹爪的平移和偏航,放置看松爪时物体相对目标的偏差。每个任务、每个阶段单独给 Δx、Δy、Δz、Δr 拟合高斯、Beta、Gamma 等候选分布,用 AIC 和 KS 检验选拟合。再从 p(d|k) 采样,扰动相对位姿后让物理引擎往前滚,得到新的失败状态,而不是回放旧轨迹。仿真里用 IK/运动规划 oracle 采短纠偏段,真机用遥操作。
第二段决定何时调用纠偏。GPT-4.1 在任务开始时把指令拆成原子阶段,一次给出名义指令、几何线索、终止谓词,以及阶段内调整和阶段后重做两类候选指令。之后不再反复调 VLM。监控器不是学习型裁判:SAM 3 出夹爪、物体、目标的 mask,Depth Anything 3 出深度,融合成点云后用技能级几何谓词做判定。几何一致就继续名义指令,阶段内偏差触发调整,阶段失败触发重做。低层动作始终由同一个 VLA 出,不另训一套 recovery 策略。
为了把恢复能力和名义成功率拆开,论文还做了 FSR-Bench:36 个双臂恢复场景,21 个易(抓空、放偏、姿态不准),15 个难(倾倒、掉落、目标被占),每条 episode 从中间失败状态起步。
仿真里每条方法 150 条名义示范,再按错误类型加 50 条轨迹。CARE 加的是经验引导纠偏,基线加等量名义原子段。
| 设置 | 基线 | CARE |
| RoboTwin 2.0 难任务 π0 | 39.6% | 60.7% |
| RoboTwin 2.0 难任务 π0-FAST | 17.4% | 33.1% |
| RoboFactory 多臂 π0 | 62.0% | 74.0% |
| RoboFactory 多臂 π0-FAST | 26.7% | 36.0% |
跨 benchmark–backbone 的平均任务成功率提升 14.5 点。FSR-Bench 上为了隔离执行机制,双方用同一套均匀采样纠偏数据。π0 的 Easy 恢复成功率从 38.8% 到 57.2%,Hard 从 15.8% 到 21.2%;三个 backbone 平均恢复成功率再加 7.5 点。
真机是双臂 SO-101,四项长程任务各 100 次。π0 从 30.8% 到 50.0%,π0-FAST 从 18.8% 到 31.3%,分别比完整复现的 FailSafe 高 13.7 和 7.3 点。
消融里纠偏数据比执行框架贡献更大:π0 上只换数据从 31.6% 到 40.8%,只加执行到 35.8%,两项一起到 54.8%。经验引导采样相对均匀随机,π0 再高 12.2 点。3D 监控相对 GPT-4.1 监控,准确率 93.8% 对 71.4%,单次 0.24 秒对 3.40 秒。
VLA 部署里最常见的不是「完全不会做」,是「做到一半偏了」。CARE 的可用之处是把本机失败分布当成数据引擎,并且纠偏仍走原来的语言接口,不必另训 recovery head。3D 谓词监控也比把失败判断交给 VLM 更稳、更便宜。
这仍是渐进改进。Hard 场景上 π0+CARE 也只有 21.2%,结构性失败远没被打穿。
论文没有单独的局限节,缺口得从设定里读。失败被建模成相对平移和偏航,倾倒、掉落这类结构异常主要靠 FSR-Bench 的执行框架去补,恢复率仍然低。新原子技能要手写谓词模板和公差。规划器只在开局问一次,任务中途不能改剧本。FSR-Bench 的训练扰动是均匀采样,跟评估用的经验失败分布刻意错开,这有利于公平对比,也说明经验引导的收益主要体现在标准任务设定里。回滚基线在附录里提升有限,论文没有把强化学习闭环补进去,只写了作为后续。