IGGT4D 把流式 4D 实例几何带进动态场景理解
zhenjun_zhao · x · 2026-07-24
IGGT4D 提出了一种流式 4D 实例感知几何 Transformer,面向动态场景理解。
从正文和配图看,这个方法的核心是:
- 输入是一段动态视频流,可选附带相机位姿;
- 通过 Tri-DPT 头逐步预测几何信息和实例特征;
- 再用流式聚类生成实例 mask,实现在线 4D 场景理解;
- 强调的是跨帧的时空一致性,而不是单帧分割。
配图里还展示了在相机位姿估计和 3D 重建上的结果,说明它关注的是实时场景几何理解这一类研究问题。
「具身」频道最新
- REK 在东京对战夜前放出武士机器人热身视频 — cixliv · 2026-07-24
- SAGE 生成可仿真 3D 场景并开源 1 万条具身数据集 — rsasaki0109 · 2026-07-24
- 清华团队用 AutoMIA 把两张图变成可 3D 打印的镜像错觉艺术 — 新智元 · 2026-07-24
- ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4% — tencent · 2026-07-24
- GLAM-SLAM 结合 ORB-SLAM2 与 Gaussian mapping 做实时大规模重建 — zhenjun_zhao · 2026-07-24
- MIT 报道:核电站正走向有人监督的自主控制 — nordicinst · 2026-07-24