BIND 动作头绑定 2D 图像特征,机器人策略更省数据更抗视角变化

yuewang314 · x · 2026-10-03

研究者提出机器人学习中的一个悖论:图像编码器的特征空间上很聪明——嵌入语义、几何信息且多视角一致;但构建在其上的机器人策略却「空间上很笨」——学会简单的抓取放置需要数百条演示,相机稍微一动就失效。

为弥合这一差距,团队提出 BIND,一种新的动作头(action head):将每个候选机器人动作绑定到其在 2D 图像上的投影特征,相当于告诉网络「选择这个动作会把末端执行器(EEF)移动到图像的这个位置」。

效果:策略数据效率大幅提升,对分布外(OOD)视角和物体位置更鲁棒;仅用 RGB 输入、无需 3D 传感器,即可输出密集的 EEF 轨迹。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →