ReViV 用单目视频重建第一视角 4D 动态
ethz-vlg · hf · 2026-07-21
ReViV 用单目第一视角视频重建“人”和“环境”的 4D 状态
ETH Zurich 等机构提出 ReViV,尝试用一段单目 RGB 第一视角视频,同时重建查看者与所见场景的 4D 表示。
- 任务被建模为联合预测多模态信号:RGB 视频、相机轨迹、注视方向、全身运动、手部运动和深度。
- 方法采用 Masked Generative Egocentric Transformer,用一个前馈式统一架构同时处理视角变化与人体运动,避免把场景理解和 ego-motion 分开建模。
- 在 HoloAssist、HOT3D、ARCTIC、Aria Digital Twin、TACO 等基准上,作者报告它在 准确率和效率 上都达到 SOTA,且不依赖重的任务特定先验。
- 项目已开源代码和模型:reviv4d.github.io。
「具身」频道最新
- 特斯拉 Robotaxi 扩至 7 个区域,奥兰多和坦帕新增开放 — elonmusk · 2026-07-22
- 周六机器人动手工作坊或成最后一场线下课 — StewartalsopIII · 2026-07-22
- NVIDIA 以世界基础模型推动物理 AI 数据生成 — MonaJalal_ · 2026-07-22
- RoboMME 基准播客预告:评测机器人通用策略的记忆 — chris_j_paxton · 2026-07-21
- gritt 称 8 人团队一天能装 3000 到 4000 块太阳能板 — HaktanSuren · 2026-07-21
- 一只氦气机器人鲸鱼,想当安静的陪伴宠物 — chris_j_paxton · 2026-07-21