VioLA 从 1.4 亿帧人体数据学通用人形控制,零样本操作成功率 88.6%
Michael_J_Black · x · 2026-10-10
Vesoma AI、MPI-IS、ETH 等团队在 arXiv 发布论文 VioLA:从人体数据学习通用人形机器人控制策略。
- 核心思路:人形机器人的关节动作空间大且强耦合,且机器人演示数据稀缺。VioLA 让通用策略预测身体与手部的运动潜变量(latent)而非关节指令,由预训练控制器执行;人体录制与机器人动作被编码进同一潜空间,从而把海量人类视频直接当作策略动作空间的标注。
- 数据规模:训练演示池含 1.406 亿帧,其中 93.2% 来自人类数据。
- 结果:在真实机器人上零样本执行运动指令,成功率 100%(对比 GR00T N1.7 为 16.7%、Ψ₀ 为 0%);无需任务特定微调的操作成功率达 88.6%。
作者包括 Michael J. Black、Andreas Krause、Georg Martius、Martin Riedmiller 等。
「具身」频道最新
- 机器人自选弱项练习,FIND 六小时练成 8 任务成功率 71.9% — GeorgiaChal · 2026-10-10
- Musk 称 Digital Optimus 已无 API 纯看屏幕打通暗黑破坏神一半剧情 — XFreeze · 2026-10-10
- 同济团队造蜘蛛网灵感六轴机械臂 3D 打印机 可打印自支撑结构 — lukas_m_ziegler · 2026-10-10
- 机器人手会翻书页了:视触觉动作模型 UVTA 成功率 70% — CyberRobooo · 2026-10-10
- 手术机器人自主缝合演示走红,医疗AI责任归属引争议 — TansuYegen · 2026-10-10
- UPenn 发布 8.5TB 多传感器机器人数据集 OctoSense,含事件相机与传感器降级场景 — RexDouglass · 2026-10-10