仅用开源模型从第一人称视频提取机器人动作信号
gui_penedo · x · 2026-08-07
Macrodata Labs 发布了一篇新的研究博客,探讨如何利用开源模型从第一人称视频中恢复缺失的动作信号(即手部在 3D 空间中的运动轨迹)。这对于利用海量网络视频训练视觉语言动作模型(VLA)至关重要,文章详细测试了纯开源方案在手部追踪上的能力极限。
所属事件:开源新方案:从第一人称视频提取机器人动作(2 条相关)→
「具身」频道最新
- Persona.AI 演示人形机器人 Gen 1 执行焊接作业 — Distinct-Question-16 · 2026-08-07
- MAD Society 推出 Physical AI 两小时速通赛 — Rewkang · 2026-08-07
- 2024年全球新装54万台工业机器人,存量近470万 — PeterDiamandis · 2026-08-07
- 特斯拉 HW3 硬件跑 FSD v14 仍受阴影困扰,车主被迫升级 — chrisfirst · 2026-08-07
- PocketJS 新作:ESP32 上跑满血 pi harness,嵌入式设备也能自进化 — dotey · 2026-08-07
- EgoHumanoid 框架发布:人类第一视角演示让机器人泛化提升 51% — micoolcho · 2026-08-07