阿里达摩院4D世界模型
机器之心 · wechat · 2026-07-17
阿里达摩院提出 RynnWorld-4D,尝试解决传统 2D 视频世界模型在机器人操控中的表征局限:纯像素预测缺少深度、运动场和物理约束,难以支撑精确三维操作。该方法在同一扩散框架里同步生成 RGB、Depth、Flow,用显式几何与运动信息构成 4D 预测。
方法上,它采用三分支 Transformer 分别建模纹理、几何和运动,并通过跨模态注意力与帧级 3D 位置编码对齐;训练分三阶段进行,还引入大规模 2.54 亿帧的 4D 标注数据管线。策略层面,模型可直接从中间层特征提取 4D 信息,一次前向就输出动作,约 1.1 秒完成推理,真机上约 9Hz。
实验显示,这套 4D 表征在深度、光流和机器人双臂灵巧操作任务上都优于基线,尤其在双手传递、盖子放置、碗具堆叠等空间精度要求高的任务里收益明显。文章最后指出,下一步瓶颈主要在推理加速和多视角扩展。
所属事件:阿里达摩院发布RynnWorld-4D机器人世界模型(2 条相关)→
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11