N_0-VTLA:首个大规模视触觉语言动作机器人模型发布
NeoteAIEmbodied · hf · 2026-08-03
研究团队推出了 N0-VTLA,一个具备精细触觉感知与控制能力的视触觉语言动作(VTLA)基础模型。这是首个在大规模触觉数据上进行预训练的 VTLA 模型。
核心技术点:
- 训练策略:包含视触觉预训练、分阶段触觉路径整合,以及基于优势条件的离线策略改进。
- 数据基础:在大规模视触觉机器人数据集 NeoData 上学习广泛的接触先验。
- 离线强化学习(ALTER):将相对进度和轨迹事件比较转化为二进制优势标签,显著提升可变形物体操作等接触密集型技能的学习效率。
测试表现:
- 赢得全部 9 项 NeoReal 真机测试任务。
- 在 20 项仿真任务中平均成功率达 63.8%(最强基线为 44.0%)。
- 在 3 项长时序真机任务中成功率达到 75-95%。
「具身」频道最新
- AgenticROS 推出机器人云服务:支持全球 P2P 远程操控与多硬件适配 — chrismatthieu · 2026-08-03
- 突破单一模型瓶颈:RoboHarness异构策略编排提升机器人长时序任务 — 机器之心 · 2026-08-03
- Foundation 机器人实现开环接球,肌腱低摩擦提升本体感受 — CyberRobooo · 2026-08-03
- 黄仁勋:视频生成模型已破解机器人物理直觉难题 — r0ck3t23 · 2026-08-03
- 曝 OpenAI 硬件版图:200 美元无屏音箱与 AI 手机均定档 2027 — 创业邦 · 2026-08-03
- ACE-Data-0 发布:150小时多模态具身数据引擎 — liuziwei7 · 2026-08-03