ActiveScale:用 1000 小时自我中心数据训练会主动观察的 VLA 机器人
zhenjun_zhao · x · 2026-09-17
论文提出 ActiveScale,从模型、数据、硬件三方面协同推进机器人主动感知,解决固定视角下任务关键信息被遮挡的问题。
- 模型:在 VLA 基础上加入历史视频观测与显式相机位姿监督,用逐帧位姿 token 和轻量预测头关联跨视角观测,形成对场景的连贯理解。
- 数据:利用人类活动中自然存在的相机运动,提出可扩展的人-机器人 mid-training 配方,使用 1000 小时自我中心与机器人数据适配时序输入和位姿监督。
- 硬件:推出主动感知移动操作平台 AMP,通过单人遥操作支持视角变化与操作协同的演示规模化采集。
- 结果:主动感知任务成功率提升;消融实验验证了相机位姿感知建模与自我中心 mid-training 的贡献。
「具身」频道最新
- VLA 模型面临语言用量、评测、部署与因果推理等多重挑战 — abursuc · 2026-09-17
- LADA:用潜动作标注低成本模仿语言功能,拆难题为两步 — abursuc · 2026-09-17
- #ssad2026 演讲附赠 Latent Action Models 入门讲解 — abursuc · 2026-09-17
- FIVE-VLA 用 640M 参数跑驾驶任务,效率达 SimLingo 7.5 倍 — abursuc · 2026-09-17
- Real-to-Sim-to-Real:保持功能的形状变形生成零样本机器人操作数据 — zhenjun_zhao · 2026-09-17
- Project Kitchen:用 VR 游戏化玩法低成本采集机器人操作数据 — zhenjun_zhao · 2026-09-17