机器人中心点图提升VLA策略

kaist-ai · hf · 2026-07-20

KAIST AI 提出了一种面向视觉-语言-动作模型(VLA)的 robot-centric pointmaps。

要解决的问题

VLA 通常从相机坐标系观察场景,但机器人动作是在机器人自身的三维坐标系里定义的。数据一旦来自多种相机位姿,这种坐标系不匹配会更严重。

方法思路

实验结果

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →