蚂蚁集团提出LingBot-VA 2.0视频-动作模型
jiqizhixin · x · 2026-07-18
蚂蚁集团提出 LingBot-VA 2.0,这是一个从零开始构建、专为真实世界控制设计的视频-动作基础模型。
与使用为数字内容设计的标准视频模型不同,该模型引入了四项突破:
- 语义-动作分词器:将机器人看到的画面与应执行的动作联系起来。
- 因果训练方法:避免遗忘过去执行过的动作。
- 稀疏 MoE 骨干网络:在不拖慢运行速度的前提下提升模型容量。
- 异步推理方案:能够在执行当前动作的同时实时预测未来步骤。
结果:在复杂操作任务中,其少样本泛化能力超越了以往的视频-动作模型。
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11