清华 OVOW:单目视频直接转物理仿真 4D 场景
机器之心 · wechat · 2026-08-18
OVOW (One Video, One World) 提出从单目视频中重建实例级 4D Mesh 场景并送入物理引擎的方法,被 ECCV 2026 接收。
核心价值
解决从视频“能渲染”到“能仿真”的跨越,输出可编辑、可碰撞的独立对象,支持重新摆放与物理计算,生成反事实交互轨迹。
技术路线
- 无大模型训练:串联视觉基础模型,依次完成场景理解、几何运动恢复、物理组装。
- 统一表示:用顶点形变处理静态、刚体与非刚体运动,不依赖预定义骨架。
性能表现
- 动态基准 Scene-IoU-OBB 0.440,处理速度 3.35 秒/帧。
- 运动类型识别、位姿恢复及仿真稳定率均在 80%-95% 以上。
应用场景
可连接 D4RT 类数据管线,为机器人策略与世界模型提供可干预的长尾训练数据。
「具身」频道最新
- MovingAtoms发布世界模型Atom 1,登顶DeepMind物理基准击败Cosmos 3 — ycombinator · 2026-08-18
- 人形机器人速滑过弯撞向配电箱演示动能传递 — rohanpaul_ai · 2026-08-18
- WuJi Hand 2 遥操作演示:20 自由度 Python SDK 控制 — chris_j_paxton · 2026-08-18
- 机器人五大热点:VLA、垂直整合、足式与轮式、Sim 数据 — chris_j_paxton · 2026-08-18
- Physical Intelligence CEO 晚宴实录:机器人数据瓶颈正在消失 — davidyin44 · 2026-08-18
- REK 机器人踢腿演示:瞬间爆发 850 磅力量 — cixliv · 2026-08-18