21组方法无一落入安全恢复,AIST综述定义机器人具身差距

The Embodiment Gap in Robot Foundation Models

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

cs.RO, cs.LG

2026-08-19

AIST把可复用模型与真机执行之间的落差称为具身差距,双轴图编码21组方法,并要求报告成功率背后的适配工作量。

这篇在解决什么

机器人基础模型(RFM),尤其是视觉-语言-动作(VLA)策略,经常被塞进语言模型那套缩放叙事:数据更多、模型更大、benchmark 更宽,泛化就会更好。机器人这边多了一层。模型可以在纸面上泛化,落到一台具体机身之前,校准、接口对齐、接触控制和失败恢复仍然要人做。

工业机器人落地里,系统集成商长期用经验和隐性知识填这块看不见的活。换成 OpenVLA、Octo、π0 这类通用策略,问题没消失,只是被成功率数字盖住了。Goldberg 指出,语言和视觉能吃到互联网规模的观测数据,机器人却很难拿到同等规模的「观测-动作命令」配对。Science Robotics 的辩论同样把数据、模型、工程的分工当成未决问题。日本产业技术综合研究所(AIST)这篇综述要回答的是:缩放能消掉哪些落差,哪些仍然必须在目标机身上做工程。

方法

具身差距(embodiment gap)被定义成:跨机器人复用的模型、表征或数据,转成匹配目标机身与控制系统的可执行动作时,仍然留下的那一段工作。同一台机器人上的灯光变化、任务适配、sim-to-real,只要不换机身,就不算。换手臂、换夹爪、换控制接口才算。

工作用一张双轴定性图来放现有方法。横轴按共享结构离真机执行有多远来排:语义与任务、感知与可供性、物体交互、动作与技能、形态感知共享。纵轴按落到目标机身上主要还剩哪一阶段来排:技能或 API 连接、校准与控制接口对齐、接触与力执行、安全与恢复。

三个研究员独立给 21 个方法组打坐标。横轴三人全一致 16/21(76.2%,Fleiss κ=0.78),纵轴全一致只有 10/21(47.6%,κ=0.33)。11 次纵轴分歧里有 10 次发生在相邻类别,多数卡在接口对齐和接触执行之间。XSkill / UniSkill 是唯一三人给出三个不同阶段的组。

三条相互重叠的研究路线对应图上不同区域。

另外提出一张 11 项报告卡,以及 Embodiment Adaptation Curve(EAC)。横轴放目标机演示数、真机试次或人工干预次数,纵轴放性能,用来看成功率是几条演示就起来,还是堆了大量真机调试才堆出来。

结果

这是综述,没有自己的成功率对照。硬数字主要来自编码一致性和现有论文的披露缺口。

项目数字
编码方法组21
共享结构轴三人全一致16/21(76.2%,κ=0.78)
剩余工作轴三人全一致10/21(47.6%,κ=0.33)
两轴同时全一致7/21(33.3%)
落入「安全/恢复」行的方法组0/21
报告卡抽查 9 组里安全干预次数不可辨7/9
9 组里标定细节不可辨3/9

落到具体系统:OpenVLA 在 Franka 上按任务用 10-150 条演示做全量微调或 rank-32 LoRA,覆盖 7 个任务;RoboCat 报告 100-1000 条样本;MOTIF 做 1-50 shot 跨具身迁移;Track2Act 用 400 条 Spot 遥操作轨迹训残差策略。EAC 能从 MOTIF 的多档演示数画出曲线,Track2Act 只有开环对残差策略两个端点,多数论文连端点都凑不齐。

纵轴编码 κ 只有 0.33,说明接口对齐和接触执行的边界本身就不稳。图上没有方法落在安全恢复,不等于问题已解决。它还没进入 RFM 的主研究目标。

为什么重要

对要在新机身上跑 VLA 的人,这篇把成功率拆成可检查的落地成本。两套系统都报相近的成功率,一套改了输出头加几十条演示,另一套全量微调加大量人工急停,实用价值完全不同。报告卡把源机、目标机、复用了什么、改了什么、目标机数据、模型更新范围、标定、真机操作、安全干预、评估 rollout、失败原因拆开。工业集成里那套看不见的活,终于有了一张可以写进论文的清单。

这是框架论文,不是新算法。它不告诉你下周该用哪套 VLA。它告诉你比较跨具身结果时,至少该问哪些问题。如果只看成功率,具身差距会继续被藏在实验室流程里。

局限与存疑

双轴图明确声明不估计工作量、不给方法排名。21 个组的坐标来自三人编码后的裁定,纵轴一致性偏低,边界规则是编码之后才补上的。文献选择偏操作任务和 VLA,行走、飞行、软体机器人基本不在范围内。Table 2 对既有论文标成 N/R,是从公开材料里读不出来,不等于作者没做那些工作。EAC 目前几乎没有论文能画出完整曲线,框架本身还缺社区采用的证据。作者用 GPT-5.5 校对并起草了 Figure 1,图的概念框架需要当人工产物来读。

未来四条优先方向写得很清楚:数据要记下动作如何变得可执行,而不只记下成功轨迹;RFM 应被设计成能协助目标机适配的系统;接触丰富执行要走向可跨身体共享的结构;评测要把拿到成功率所花的工作量算进去。这些是议程,还不是已经验证的方法。

术语

原文与代码

社区讨论

相关论文

全部论文解读