微软研究院开源 5B 视觉-语言-动作模型 Rho,瞄准机器人快速适配新任务

chris_j_paxton · x · 2026-10-01

微软研究院的 Andrey Kolobov 宣布开源 Rho——一组 5B 参数的 VLA(视觉-语言-动作)模型,是微软 Rho-alpha VLA+ 工作的底层模型,项目页面、技术报告、代码与模型数据全部公开。

动机:机器人操作者常用的离线监督微调(SFT)太吃数据,因为它除了学任务本身还要同时做两件事——(1) 掌握机器人本体的控制,(2) 覆盖大量目标任务与环境变化。

做法:为缓解第一重负担,团队发布了在 i2rt YAM Box、Universal Robots AI Trainer、FRANKA FR3 Duo 等真机平台上做过 midtraining 的检查点,让物理 AI 更容易适配新任务和新环境。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →