清华联合伯克利提出连续时间具身世界模型 ODEWorld
新智元 · wechat · 2026-08-05
清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 团队联合提出了全球首个连续时间具身世界模型 ODEWorld。传统视觉世界模型依赖离散帧预测,难以捕捉两帧之间的物理瞬间变化,而 ODEWorld 转向直接学习世界在真实物理时间中的连续变化率。
核心技术设计:
- 静动态解耦:利用冻结的 DINOv2 提取特征,将静态背景与动态变化分离。动态潜变量被极致压缩至单个 1×768 token,避免了背景信息的重复计算。
- 一阶速度监督:通过雅可比向量积(JVP)直接监督潜状态的一阶时间导数,有效避免了表征坍缩问题,使潜空间保留了更高的有效秩。
- Savitzky–Golay 滤波:用于平滑相邻帧特征的高频抖动,提取稳定的物理变化速度供模型学习。
能力与性能:
基于常微分方程(ODE)求解器进行积分,ODEWorld 将原本独立的任意帧率生成、时间补全(补帧)与反向生成统一为同一套连续时间预测范式(PT-Flow)。
在 LIBERO 视频预测实验中,ODEWorld 在 64 帧长程预测上不仅画质(PSNR/LPIPS)优于 LDP 和 V-JEPA2,且生成速度极快:生成 64 帧仅需 0.072 秒,分别是 LDP 的 1/55 和 V-JEPA2 的 1/8.6。
「具身」频道最新
- 世界模型成中国具身智能突破口:依托供应链优势抢跑 — pstAsiatech · 2026-08-05
- Simple World Lab 开源 16TB 机器人操作数据集 HiFi-UMI-2K — AIFlow_ML · 2026-08-05
- Niantic Spatial 为加州城市构建实体 AI 数字孪生 — petewoodbridge · 2026-08-05
- 极客 DIY:将机器人技术与创意灯具设计结合的机械臂 — kamathsblog · 2026-08-05
- 特斯拉 Optimus 机器人现身餐厅,精准盛爆米花 — TansuYegen · 2026-08-05
- 元点机器人发布全尺寸人形 Jupiter 与可拆分机械臂 N1 — 新智元 · 2026-08-05