RLHND:用视频扩散模型同时追踪手部姿态与触觉,助力机器人学习
RLWRLD · hf · 2026-10-08
RLHND 提出将预训练视频基础模型(Cosmos 3 视频扩散骨干)改造为确定性片段级特征提取器,从单目第一人称视频联合估计手部姿态与触觉信息,用于机器人策略训练。
核心要点:
- 问题:现有人手追踪器从裁剪帧回归姿态,缺乏手部运动与物体交互先验,且缺少接触、受力等物理线索,限制了人类视频在机器人训练中的应用。
- 方法:通过 clean-latent conditioning 保留视频模型学到的手-物交互先验;姿态流预测解剖学合理的关节角度,并支持形状参数条件化以保持跨帧/跨视频的手形一致;独立的触觉专家流(姿态流冻结)预测手部表面密集接触与受力。
- 效率:采用基于 LBS 的特征扩散,避免昂贵的逐顶点注意力。
- 结果:在多个基准上取得姿态估计、接触与受力估计的 SOTA,并通过重定向与真实机器人实验验证了其对机器人学习的实用价值。
代码将开源。
「具身」频道最新
- NEEDLEwork 缝合次优与失败轨迹,重写机器人训练数据 — SongShuran · 2026-10-08
- 斯坦福 MobileVISTA:单一基座位姿采集数据,即可泛化到多姿态操作 — jiajunwu_cs · 2026-10-08
- 把斑马鱼大脑编译进仿真器,效率达脉冲模型 26 倍,浏览器可跑 — mtizard · 2026-10-08
- 美国开出对外投资新规首张罚单:未申报中国机器人 AI 投资 — pstAsiatech · 2026-10-08
- Palmer Luckey:看好人形机器人,但不打算亲自下场做 — PeterDiamandis · 2026-10-08
- 用 SAM 2 给机器人 VLA 补上运动感知,成功接住移动瓶子 — nikhilaravi · 2026-10-08