阿里达摩院4D世界模型
机器之心 · wechat · 2026-07-17
阿里达摩院提出 **RynnWorld-4D**,尝试解决传统 2D 视频世界模型在机器人操控中的表征局限:纯像素预测缺少深度、运动场和物理约束,难以支撑精确三维操作。该方法在同一扩散框架里同步生成 **RGB、Depth、Flow**,用显式几何与运动信息构成 4D 预测。 方法上,它采用三分支 Transformer 分别建模纹理、几何和运动,并通过跨模态注意力与帧级 3D 位置编码对齐;训练分三阶段进行,还引入大规模 2.54 亿帧的 4D 标注数据管线。策略层面,模型可直接从中间层特征提取 4D 信息,一次前向就输出动作,约 1.1 秒完成推理,真机上约 9Hz。 实验显示,这套 4D 表征在深度、光流和机器人双臂灵巧操作任务上都优于基线,尤其在双手传递、盖子放置、碗具堆叠等空间精度要求高的任务里收益明显。文章最后指出,下一步瓶颈主要在推理加速和多视角扩展。
所属事件:阿里达摩院发布RynnWorld-4D机器人世界模型(2 条相关)→
「具身」频道最新
- 有人质疑人形机器人演示失真,AMR 和节拍时间才是瓶颈 — chris_j_paxton · 2026-07-21
- Generative Bionics 人形机器人六个月走到可行走平台 — CyberRobooo · 2026-07-21
- Auki 推出面向门店、仓库和供应链的物理 AI 基础设施 — broodsugar · 2026-07-21
- 安全强化学习方向约束论文被 IROS 2026 接收 — Jan_R_Peters · 2026-07-21
- Sunday Robotics 称只需一个样本就能教家用机器人新动作 — saranormous · 2026-07-21
- 旧金山首场 6 英尺人形机器人对打招赞助 — cixliv · 2026-07-21