康奈尔 UMA 机器人模型:25 段人类视频即可教会新任务,权重冻结
qinzytech · x · 2026-10-06
康奈尔的 Unified Motion-Action (UMA) 模型展示了:机器人只需看 25 段人类视频演示就能学会新任务,模型权重全程冻结,适配只更新一小撮表示『要做什么』的任务 token。
- 技术路线:通过 3D 物体上点的运动把人类视频与机器人控制连接起来——从无机器人动作标签的视频中学习运动,再从机器人数据中学习运动与动作的关联。预训练混合了人类视频、真实机器人演示与仿真数据。
- 成绩:纯视频适配下,UMA 在餐具插入、扫地、叠牛仔裤三个任务上比 UVA 高约 25 个百分点成功率(每任务 20 次评估),人类演示来自评估场景与视角。
- 实际意义:新任务无需采集机器人动作标注即可教学;但部署到新机器人本体仍需兼容的机器人数据。作者也指出跨场景/视角的迁移是下一步待验证的问题。
「具身」频道最新
- Embodied Analysis 发布统一评测平台:物理智能体与世界模型同框架横评 — qinzytech · 2026-10-06
- T²Mem 让机器人策略学会记忆,π₀.₅ 成功率从 17.9% 升至 56.8% — yining_hong · 2026-10-06
- 原子级「走路」的铂钛致动器:一年前演讲仅 2 千播放 — Promptmethus · 2026-10-06
- Manda Robotics 实测:Newton、MuJoCo、Genesis 处理可变形物体差异显著 — facontidavide · 2026-10-06
- 摩根士丹利预测:25年内全球人形机器人保有量将达10亿台 — Rewkang · 2026-10-06
- 谷歌推 899 美元 Googlebook,主打与安卓手机无缝协同 — sundarpichai · 2026-10-06