Being-H0.8 用 50 万小时视频给机器人世界模型加上触觉

量子位 · wechat · 2026-07-28

BeingBeyond 发布了首个基于人类视频数据的隐式触觉世界-动作模型 Being-H0.8。它的核心变化,是把触觉纳入机器人对世界的隐空间预测中,让模型不只“看见”动作,还能提前判断接触会在哪里发生、力度会如何变化。

这套系统披露了几项关键信息:一是使用了 50 万小时以上 的第一人称视频数据,并配套完成过滤、切分、语言标注、手部运动恢复与跨模态校准;二是通过 TactoHand 从普通视频里恢复接触/邻近度监督,再结合压力手套等真实传感器补充物理压力信息;三是用通用触觉编码器把不同来源的触觉信号统一成 token,再用 TopoHand 对齐人手、灵巧手和平行夹爪的动作表征。

在真实双臂机器人测试中,系统完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖触觉反馈的精细任务。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →