N₀-TWAM 让机器人预测触觉,接触任务成功率升至 46.3%
imjustnewatai · x · 2026-07-29
N₀-TWAM 让机器人不只“看见”,还要“感到”下一秒
这篇机器人论文的核心想法是:很多接触类任务里,摄像头并不能判断插头是否插到底、杯子是否在打滑、夹爪到底夹住了物体还是只夹到了空气。于是 N₀-TWAM 同时预测三件事:下一帧画面、指尖接触状态、以及最可能产生这两者的动作;模型还会读取当前的力反馈。
训练规模与数据
- 参数量:7.16B
- 训练数据:约 750 万段 clip
- 覆盖 6 种机器人本体、450 个任务
- 每段数据都对齐了视频、语言、动作和逐指触觉信号
结果
- 在 8 个真实接触密集任务上,平均成功率 46.3%
- 最强 vision-language-action baseline 为 30%
- 在“立瓶子”任务上,模型达到 70%,而最佳 baseline 只有 20%
- 在主要依赖视觉定位的任务上,纯视觉模型也能持平或略优
论文想说明什么
- 去掉“未来触觉预测”后,平均分从 67.0% 降到 56.4%
- 去掉“当前触觉信号”后,进一步降到 50.0%
- 说明主要收益来自那些摄像头看不出来、但物理世界里又很关键的状态
作者把触觉类比成“物理 AI 的验收信号”:机器人不能只做出动作,还要有现实反馈证明动作确实完成了。文中还提到一个潜在的数据壁垒——公开视频很多,但同步记录“物体被抓、扭、插、剥、掉落时到底是什么感觉”的数据几乎没有。
所属事件:N₀-TWAM 赋予机器人触觉预测能力(2 条相关)→
「具身」频道最新
- 中国机器狗进化至三合一,演示效果酷炫 — TinfoilTricorn · 2026-08-24
- WatchGPT 更新支持 OpenAI 实时语音模型 — AIandDesign · 2026-08-24
- 30 天交付人形机器人全案,团队协作是核心优势 — yongqianme · 2026-08-24
- 室内骑行爱好者可用 VR 设备应对雨季 — AryHHAry · 2026-08-24
- Figure 机器人展示全自动爬楼能力 — DeryaTR_ · 2026-08-24
- 成功部署 Qwen 27B 并接入 HomeAssistant 实现控制 — sshwifty · 2026-08-24