阿里和港中文用一张图预测机器人场景的 4D 未来
jiqizhixin · x · 2026-07-26
阿里和港中文让机器人看一张图就预测 4D 未来
阿里达摩院与香港中文大学研究者提出 RynnWorld-4D:输入一张 3D 图像和一条语言指令,就能一次性生成未来帧、深度图和光流,帮助机器人形成更具物理感知的时空理解。
- 该方法试图把物体如何在时间和空间中变化,建模成统一的 4D 表示。
- 在真实世界的双臂操作任务上,据称优于此前方法,尤其在空间精度和时间协同要求高的场景里更明显。
- 原帖同时附了项目页、论文、代码和机器之心报道链接。
「具身」频道最新
- OnePlus 12 本地跑图像模型,320×320 仍要几分钟 — sgcego · 2026-07-26
- Orca 开源灵巧手研究栈,打通遥操作与训练 — tensorqt · 2026-07-26
- 黄仁勋称 Optimus 可能催生万亿美元级人形机器人产业 — XFreeze · 2026-07-26
- 本周 AI 论文盘点:世界模型、具身智能体与自改进 agent — _akhaliq · 2026-07-26
- Vivix A1 可在交互中途接收语音、文本和图像 — Scobleizer · 2026-07-26
- Vivix A1 展示语音、眼神与动作同步的具身交互 — Scobleizer · 2026-07-26