开源具身视频模型LingBot-Video
HeyNayeem · x · 2026-07-12
Robbyant 开源了 LingBot-Video,作者强调它不是面向通用视频生成,而是专门为具身智能设计的“机器人脑”底座。
核心内容包括:
- 用于动作条件生成/rollout 的评测表明,它并不只是记忆训练轨迹,而是在未见过的数据上也能工作。
- 后训练阶段使用 6 种奖励信号,不只是审美分数,还包括视觉质量、图文对齐、动态程度、运动一致性、人类动作一致性,以及专门的物理可行性信号。
- 数据层面,除了互联网视频,还叠加了 7 万小时以上的具身数据,覆盖机器人操作、导航和第一视角内容,并按 192p → 1080p 的 5 阶段课程训练。
- 架构上是 稀疏 MoE:总参数 30B、每步只激活 3B;作者还提到在 1M token 序列上,吞吐能达到同规模 Dense 30B 的约 3 倍。
- 评测上,RBench 平均分 0.620,在表格中领先开源和闭源基线;作者还指出闭源 Wan 2.6 在空间、单臂和双臂任务上仍然更强,但整体并非全面碾压。
所属事件:具身智能视频模型LingBot-Video宣布开源(4 条相关)→
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11