UVTA 论文开源:人类示范 + 机器人示范学出视触觉统一表征
CyberRobooo · x · 2026-10-10
上海交大人工智能学院团队发布 UVTA(Unified Visual-Tactile-Action Modeling)项目主页,论文、代码与数据集均已开放。
- 动机:灵巧操作离不开触觉,但在机器人手上采集触觉示范难以规模化;人类交互提供了可扩展的接触经验来源。
- 系统:被动式 22 自由度外骨骼以 30Hz 同步采集腕部 RGB 图像、20 维触觉和 31 维动作;每任务约 1000 条人类示范 + 约 150 条机器人示范,数据集已上架 Hugging Face。
- 模型:384 维视觉 token 与 20 维触觉 token 融合成 404 维交互表征,用扩散动作头生成 16 步动作块,并通过未来触感预测辅助训练。
- 主张跨具身迁移:手可以换,接触物理不变。
所属事件:上交大发布 UVTA:视触觉统一模型让机器手学会翻书页(3 条相关)→
「具身」频道最新
- 「完美十分但她是个机器人」:人形机器人 demo 引围观 — creatoroff · 2026-10-10
- 仅 600 万参数的 DepthART 把深度基础模型塞进边缘设备 — jiqizhixin · 2026-10-10
- 小鹏亮相巴黎车展主打 Physical AI,纯视觉 FSD 拟扩张至欧洲 — LinusEkenstam · 2026-10-10
- 机器人自选弱项练习,FIND 六小时练成 8 任务成功率 71.9% — GeorgiaChal · 2026-10-10
- Musk 称 Digital Optimus 已无 API 纯看屏幕打通暗黑破坏神一半剧情 — XFreeze · 2026-10-10
- 同济团队造蜘蛛网灵感六轴机械臂 3D 打印机 可打印自支撑结构 — lukas_m_ziegler · 2026-10-10