The Embodiment Gap in Robot Foundation Models
Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai
cs.RO, cs.LG
2026-08-19
AIST把可复用模型与真机执行之间的落差称为具身差距,双轴图编码21组方法,并要求报告成功率背后的适配工作量。
机器人基础模型(RFM),尤其是视觉-语言-动作(VLA)策略,经常被塞进语言模型那套缩放叙事:数据更多、模型更大、benchmark 更宽,泛化就会更好。机器人这边多了一层。模型可以在纸面上泛化,落到一台具体机身之前,校准、接口对齐、接触控制和失败恢复仍然要人做。
工业机器人落地里,系统集成商长期用经验和隐性知识填这块看不见的活。换成 OpenVLA、Octo、π0 这类通用策略,问题没消失,只是被成功率数字盖住了。Goldberg 指出,语言和视觉能吃到互联网规模的观测数据,机器人却很难拿到同等规模的「观测-动作命令」配对。Science Robotics 的辩论同样把数据、模型、工程的分工当成未决问题。日本产业技术综合研究所(AIST)这篇综述要回答的是:缩放能消掉哪些落差,哪些仍然必须在目标机身上做工程。
具身差距(embodiment gap)被定义成:跨机器人复用的模型、表征或数据,转成匹配目标机身与控制系统的可执行动作时,仍然留下的那一段工作。同一台机器人上的灯光变化、任务适配、sim-to-real,只要不换机身,就不算。换手臂、换夹爪、换控制接口才算。
工作用一张双轴定性图来放现有方法。横轴按共享结构离真机执行有多远来排:语义与任务、感知与可供性、物体交互、动作与技能、形态感知共享。纵轴按落到目标机身上主要还剩哪一阶段来排:技能或 API 连接、校准与控制接口对齐、接触与力执行、安全与恢复。
三个研究员独立给 21 个方法组打坐标。横轴三人全一致 16/21(76.2%,Fleiss κ=0.78),纵轴全一致只有 10/21(47.6%,κ=0.33)。11 次纵轴分歧里有 10 次发生在相邻类别,多数卡在接口对齐和接触执行之间。XSkill / UniSkill 是唯一三人给出三个不同阶段的组。
三条相互重叠的研究路线对应图上不同区域。
另外提出一张 11 项报告卡,以及 Embodiment Adaptation Curve(EAC)。横轴放目标机演示数、真机试次或人工干预次数,纵轴放性能,用来看成功率是几条演示就起来,还是堆了大量真机调试才堆出来。
这是综述,没有自己的成功率对照。硬数字主要来自编码一致性和现有论文的披露缺口。
| 项目 | 数字 |
| 编码方法组 | 21 |
| 共享结构轴三人全一致 | 16/21(76.2%,κ=0.78) |
| 剩余工作轴三人全一致 | 10/21(47.6%,κ=0.33) |
| 两轴同时全一致 | 7/21(33.3%) |
| 落入「安全/恢复」行的方法组 | 0/21 |
| 报告卡抽查 9 组里安全干预次数不可辨 | 7/9 |
| 9 组里标定细节不可辨 | 3/9 |
落到具体系统:OpenVLA 在 Franka 上按任务用 10-150 条演示做全量微调或 rank-32 LoRA,覆盖 7 个任务;RoboCat 报告 100-1000 条样本;MOTIF 做 1-50 shot 跨具身迁移;Track2Act 用 400 条 Spot 遥操作轨迹训残差策略。EAC 能从 MOTIF 的多档演示数画出曲线,Track2Act 只有开环对残差策略两个端点,多数论文连端点都凑不齐。
纵轴编码 κ 只有 0.33,说明接口对齐和接触执行的边界本身就不稳。图上没有方法落在安全恢复,不等于问题已解决。它还没进入 RFM 的主研究目标。
对要在新机身上跑 VLA 的人,这篇把成功率拆成可检查的落地成本。两套系统都报相近的成功率,一套改了输出头加几十条演示,另一套全量微调加大量人工急停,实用价值完全不同。报告卡把源机、目标机、复用了什么、改了什么、目标机数据、模型更新范围、标定、真机操作、安全干预、评估 rollout、失败原因拆开。工业集成里那套看不见的活,终于有了一张可以写进论文的清单。
这是框架论文,不是新算法。它不告诉你下周该用哪套 VLA。它告诉你比较跨具身结果时,至少该问哪些问题。如果只看成功率,具身差距会继续被藏在实验室流程里。
双轴图明确声明不估计工作量、不给方法排名。21 个组的坐标来自三人编码后的裁定,纵轴一致性偏低,边界规则是编码之后才补上的。文献选择偏操作任务和 VLA,行走、飞行、软体机器人基本不在范围内。Table 2 对既有论文标成 N/R,是从公开材料里读不出来,不等于作者没做那些工作。EAC 目前几乎没有论文能画出完整曲线,框架本身还缺社区采用的证据。作者用 GPT-5.5 校对并起草了 Figure 1,图的概念框架需要当人工产物来读。
未来四条优先方向写得很清楚:数据要记下动作如何变得可执行,而不只记下成功轨迹;RFM 应被设计成能协助目标机适配的系统;接触丰富执行要走向可跨身体共享的结构;评测要把拿到成功率所花的工作量算进去。这些是议程,还不是已经验证的方法。