机器人中心点图提升VLA策略
kaist-ai · hf · 2026-07-20
KAIST AI 提出了一种面向视觉-语言-动作模型(VLA)的 robot-centric pointmaps。
要解决的问题
VLA 通常从相机坐标系观察场景,但机器人动作是在机器人自身的三维坐标系里定义的。数据一旦来自多种相机位姿,这种坐标系不匹配会更严重。
方法思路
- 用每个像素存储机器人坐标系中的 3D 坐标来表示图像
- 保留预训练 2D VLA 期待的 H × W 稠密网格结构
- 能以很小的架构改动接入现有 VLA
实验结果
- 在 RoboCasa 上,pointmaps 提升了 pi0.5 和 SmolVLA 的表现
- 优于相机视角基线和若干 3D 感知基线
- 真机实验里,当相机位置换到训练中没见过的地方时,优势更明显
「具身」频道最新
- 特斯拉 Robotaxi 扩至 7 个区域,奥兰多和坦帕新增开放 — elonmusk · 2026-07-22
- 周六机器人动手工作坊或成最后一场线下课 — StewartalsopIII · 2026-07-22
- NVIDIA 以世界基础模型推动物理 AI 数据生成 — MonaJalal_ · 2026-07-22
- RoboMME 基准播客预告:评测机器人通用策略的记忆 — chris_j_paxton · 2026-07-21
- gritt 称 8 人团队一天能装 3000 到 4000 块太阳能板 — HaktanSuren · 2026-07-21
- 一只氦气机器人鲸鱼,想当安静的陪伴宠物 — chris_j_paxton · 2026-07-21