开源实战:用第一人称视频与手部追踪提取机器人动作

gui_penedo · x · 2026-08-07

Macrodata Labs 发布了一篇深度技术博客,探讨如何仅使用 RGB 第一人称视频构建手部动作提取管线,从而为机器人动作提供监督数据,摆脱对昂贵遥操硬件的依赖。

核心挑战与评估

团队在 HOT3D 数据集上评估了完整的手部追踪管线,提出 Action MPJPE 指标。一个可行的系统必须达到 75% 以上的直接预测覆盖率和 H100 上 15 FPS 的性能。

系统优化与结论

最终系统结合了 WiLoR 检测、HaWoR 手部重建和 VGGT-Omega 相机轨迹,实现了 52.04 mm 的动作误差和 15.53 FPS 的吞吐量。相比原版 HaWoR,误差从 59.12 降至 52.04 mm,速度从 3.34 提升至 15.53 FPS。研究发现手部重建是最大的误差来源,其中深度估计问题占了约 43% 的误差。

所属事件:开源新方案:从第一人称视频提取机器人动作(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →