$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
NeoteAI Team, Fudan TEAI Team
cs.RO
2026-07-27
首个大规模触觉预训练的VTLA模型。不喂当前触觉、改让策略依据预测的未来接触动作(触觉最值钱的是接触前的预判),20任务胜率63.8%对π0.5的44.0%。
VLA(视觉-语言-动作)模型让机械臂策略变得通用,但它们基本只有视觉、没有触觉。结果在接触密集任务(插孔、叠毛巾、拧螺丝)上始终偏弱:看不到接触就要发生的瞬间,动作就来不及调整。
把触觉加进 VLA 的现有做法有两条,作者认为都不对。一是把触觉 token 拼进视觉-语言前缀,但触觉信号稀疏、大部分时间是沉默的,塞进为信息密集画面设计的前缀里买不到什么。二是把当前触觉读数注入动作通路,但这记录的是「已经发生的接触」,策略永远慢自己一步。
N0-VTLA 走第三条路:不喂当前触觉,让动作专家依据「预测的未来接触」做动作。论据很直接:触觉最值钱的时刻是预判性的,比如夹爪闭合前那毫米级的预压、物体将滑未滑的瞬间。这些时刻在「接触前」的盲区里,纯反应式信号来不及塑造引发它的那个动作。
具体分三步:
还有一个 ALTER:从部署数据做离线强化学习。它把干净演示的密集阶段进度、和掉物或人工干预事件带来的稀疏偏好,一起训一个成对进度模型,再冻住它给每条轨迹打「优势正/负」标签塞进任务提示词,部署时恒用「正」。
预训练语料是团队自建的 NeoData 大规模视触觉数据集,自称首个在触觉数据上规模化预训练的 VTLA 模型。真机 NeoReal 九个任务,N0-VTLA 全胜,平均成功率 47.2% 对 π0.5 的 29.4%,进度分 56.8 对 42.3;ACT 一个任务都没完成。插孔任务上到 85% 对 60%,且抗日光变化、能从失败插入中恢复。
仿真上,8 个 UniVTAC 任务平均 83.1%,最强外部基线 InternVLA-A1 是 67.1%;12 个更难的 NeoSim 任务,N0-VTLA 50.8% 对 π0.5 的 45.8%。双臂任务明显更难:单臂平均 73.8%,双臂腰斩到 39.4%,几个专用基线在双臂上掉到个位数(InternVLA-A1 双臂仅 1.0%)。20 个任务合计 63.8% 对 44.0%。ALTER 在叠毛巾、装袋、折纸箱三个长程任务上,N0-VTLA+ALTER 达 95%/80%/75%,π0.5+ALTER 是 90%/75%/60%。
触觉是机器人操作里公认的硬骨头,而多数 VLA 还在纯视觉打转。这篇的核心贡献不是「加了触觉」,而是给出了一个清晰的归纳偏置:触觉该用来预判,不是用来反应。对做具身智能和操作策略的人,这套「预测式潜在触觉加三阶段接入」是个可复用的配方。它也第一次在触觉数据上做到了规模化预训练。
双臂任务的成功率(39.4%)暴露了当前上限,接触更复杂、协调更难,模型还没真正拿下。其次是可复现性:NeoData 数据集和触觉传感器都是团队自研自用,外部很难拿来对比;外部基线虽多,但评测协议是作者定的。另外「预测优于反应」是个假设,在这套设置上成立,是否在所有接触形态下都占优,论文没有系统排除反例。