上交大 UVTA 用 1000 条人类触觉示范教会机器人灵巧操作

siyuanhuang95 · x · 2026-10-10

上海交通大学团队发布 UVTA(Unified Visual-Tactile-Action Modeling),提出「人类触觉而非仅人类动作」才是规模化机器人灵巧操作的关键路径。

系统与数据:用被动 22 自由度外骨骼同步采集手部运动、指尖压力、腕部位姿与腕载 RGB 视觉;每任务采集约 1000 条人类示范 + 约 150 条机器人示范,数据含腕部 RGB(20 维触觉、31 维动作、30Hz),数据集已上 Hugging Face。

模型:384 维视觉 token 与 20 维触觉 token 融合为 404 维交互表示,通过动作扩散头(Diffusion action head)生成 16 步相对腕部与绝对手指关节动作,并以未来触觉预测辅助训练。项目页、论文与代码均已公开。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →