机器人数据训练的视频基础模型

heyshrutimishra · x · 2026-07-13

LingBot-Video 不是主要从互联网视频学,而是大量使用机器人数据训练出来的。

作者强调它的训练数据包含 7 万多小时的 embodied footage,覆盖机器人操控、导航和第一人称交互。相比只看视频外观,机器人数据更能教会模型“物体怎么动”“受力后会怎样”“真实交互里会发生什么”。

它的奖励系统也很特别:6 个信号里只有 1 个直接偏向视觉质量,其余更多约束对齐、运动、人形一致性和物理合理性。

在 RBench 上它拿到 0.620,帖子称这是列表里开源和闭源模型中的最高分,并在 Manipulation、Long-horizon、Quadruped 任务上领先。

作者给它的定位也不只是视频生成器,而是 embodied AI 的基础模型,可用于数据生成、物理场景模拟和机器人策略流程探索,帮助减少昂贵的真实机器人试跑。

所属事件:具身智能视频模型LingBot-Video宣布开源(4 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →