微软研究院开源 5B 视觉-语言-动作模型 Rho,瞄准机器人快速适配新任务
chris_j_paxton · x · 2026-10-01
微软研究院的 Andrey Kolobov 宣布开源 Rho——一组 5B 参数的 VLA(视觉-语言-动作)模型,是微软 Rho-alpha VLA+ 工作的底层模型,项目页面、技术报告、代码与模型数据全部公开。
动机:机器人操作者常用的离线监督微调(SFT)太吃数据,因为它除了学任务本身还要同时做两件事——(1) 掌握机器人本体的控制,(2) 覆盖大量目标任务与环境变化。
做法:为缓解第一重负担,团队发布了在 i2rt YAM Box、Universal Robots AI Trainer、FRANKA FR3 Duo 等真机平台上做过 midtraining 的检查点,让物理 AI 更容易适配新任务和新环境。
「具身」频道最新
- 西方机器人公司忽视「便宜」,人形机器人竞争本质是成本战 — hudzah · 2026-10-01
- 博主预言人形机器人将进驻酒店洗衣等场景 — CyberRobooo · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- 清华博士创业做餐饮后厨机器人,已完成千万级种子轮 — 创业邦 · 2026-10-01
- GPT-6 Astra 机器人实测:任务决策强,物理控制仍是短板 — Galbot · 2026-10-01
- 清华 RoboCoach 用世界模型当教练,150 次演示把成功率从 13.3% 拉到 75% — Tsinghua · 2026-10-01