小米开源VLA机器人基础模型
XiaomiRobotics · hf · 2026-07-20
小米机器人发布 Xiaomi-Robotics-1,这是一个视觉-语言-动作(VLA)基础模型,目标是在未见环境中直接完成多种移动操作任务,并以少量微调适配新任务。
论文采用两阶段训练:
- 预训练:使用通过 UMI 设备采集的 10 万小时以上真实世界操作轨迹,并用自动标注管线把轨迹切片转成自然语言状态转移描述。
- 后训练:让模型更贴合具体机器人本体和人类常用的指令方式。
实验显示模型随数据规模和模型大小扩大而持续变强;在多个仿真基准上超过现有方法。它在 RoboCasa365 上达到 57.6% 成功率,优于此前 46.6%;在 RoboDojo 上拿到 20.07 分,高于此前 13.07。代码和模型权重将发布。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11