机器人中心点图提升VLA策略
kaist-ai · hf · 2026-07-20
KAIST AI 提出了一种面向视觉-语言-动作模型(VLA)的 robot-centric pointmaps。
要解决的问题
VLA 通常从相机坐标系观察场景,但机器人动作是在机器人自身的三维坐标系里定义的。数据一旦来自多种相机位姿,这种坐标系不匹配会更严重。
方法思路
- 用每个像素存储机器人坐标系中的 3D 坐标来表示图像
- 保留预训练 2D VLA 期待的 H × W 稠密网格结构
- 能以很小的架构改动接入现有 VLA
实验结果
- 在 RoboCasa 上,pointmaps 提升了 pi0.5 和 SmolVLA 的表现
- 优于相机视角基线和若干 3D 感知基线
- 真机实验里,当相机位置换到训练中没见过的地方时,优势更明显
「具身」频道最新
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11
- AUAR 推移动微型工厂:为每块木板定制生成机器人加工方案 — lukas_m_ziegler · 2026-09-11
- 马斯克转发:Cybercab 认证能效 165 Wh/mi,史上最高效量产电动车 — elonmusk · 2026-09-11