仅用开源模型从第一人称视频提取机器人动作信号

gui_penedo · x · 2026-08-07

Macrodata Labs 发布了一篇新的研究博客,探讨如何利用开源模型从第一人称视频中恢复缺失的动作信号(即手部在 3D 空间中的运动轨迹)。这对于利用海量网络视频训练视觉语言动作模型(VLA)至关重要,文章详细测试了纯开源方案在手部追踪上的能力极限。

所属事件:开源新方案:从第一人称视频提取机器人动作(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →