LingBot-VA 2.0发布
CyberRobooo · x · 2026-07-10
@robbyantbrain 发布 LingBot-VA 2.0,自称是首个真正的 embodied-native 基础模型,强调不是从视频生成模型微调而来,而是为物理世界从头构建。
文中给出几项关键结果与设计:
- RoboTwin 2.0 双臂任务成功率 93.6%
- 在优化后的 FP8/TensorRT 栈上,峰值异步执行频率达到 225Hz
- 只用 10–15 次演示就能较好泛化,并支持用人类参考视频作为上下文进行 in-context learning,且无需参数更新
架构上,它包含语义视觉-动作 tokenizer、带稀疏 MoE 的 causal DiT,以及名为 Foresight Reasoning 的机制:在机器人运动过程中预测下一时刻的世界状态。作者还表示,这一周发布的多个组件一起构成了一个“闭环”的具身全栈:
- LingBot-Depth 2.0
- LingBot-Vision
- LingBot-VLA 2.0
- LingBot-World 2.0
- LingBot-Video
- LingBot-VA 2.0
整体主张是:同一个“脑”可以服务多种机器人。
所属事件:LingBot-VA/VLA 2.0发布:原生具身基础模型与跨机身控制(24 条相关)→
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11