机器人数据训练的视频基础模型
heyshrutimishra · x · 2026-07-13
LingBot-Video 不是主要从互联网视频学,而是大量使用机器人数据训练出来的。
作者强调它的训练数据包含 7 万多小时的 embodied footage,覆盖机器人操控、导航和第一人称交互。相比只看视频外观,机器人数据更能教会模型“物体怎么动”“受力后会怎样”“真实交互里会发生什么”。
它的奖励系统也很特别:6 个信号里只有 1 个直接偏向视觉质量,其余更多约束对齐、运动、人形一致性和物理合理性。
在 RBench 上它拿到 0.620,帖子称这是列表里开源和闭源模型中的最高分,并在 Manipulation、Long-horizon、Quadruped 任务上领先。
作者给它的定位也不只是视频生成器,而是 embodied AI 的基础模型,可用于数据生成、物理场景模拟和机器人策略流程探索,帮助减少昂贵的真实机器人试跑。
所属事件:具身智能视频模型LingBot-Video宣布开源(4 条相关)→
「具身」频道最新
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11
- AUAR 推移动微型工厂:为每块木板定制生成机器人加工方案 — lukas_m_ziegler · 2026-09-11