ViDiHand:视频扩散模型逆袭,从第一视角视频重建 4D 双手动作
ccloy · x · 2026-10-06
NTU MMLab 等团队发布 ViDiHand,首个利用预训练视频扩散模型从自我中心(egocentric)视频重建 4D 双手运动的方法。
- 问题背景:具身 AI 兴起使第一视角人手视频成为机器人操作策略学习的重要监督来源(EgoDex、EgoVLA 等),但真实场景遮挡严重,现有图像法一旦检测失败即重建失败,时序法又缺标注。
- 方法:不把扩散模型当冻结特征提取器,而是通过手部叠加渲染任务微调,再用双分支解码器从特征中读出关节级 3D 姿态与逐关节 2D 定位,双手以公制尺度锚定。
- 论文、项目页与代码均已公开,HF 上另有后续工作 ACE-Ego-Hand。
「具身」频道最新
- VC:机器人部署真实数据几乎没回流训练,物理 AI 生态封闭 — carrycooldude · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- ACG-Bench测双臂VLA组合泛化,AE-VLA把成功率从3%拉到21.5% — Zaibin Zhang · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 机器人加持篮筐弹板修正,新手也能百发百中投进三分 — TinfoilTricorn · 2026-10-06
- Xitac 触觉传感器:磁敏凝胶+3D 霍尔阵列捕捉手指力数据 — seanmcdonaldxyz · 2026-10-06