DeepMind 把视频变成可查询4D世界
anselm · x · 2026-07-17
Google DeepMind 展示了一个把普通视频走查转换成“可用自然语言查询的 4D 世界”的系统。
- 输入是原始视频,不需要手工标注、不需要预先打标签。
- 系统会把视频拆成多层表示:深度图、表面法线、相机射线图和分割掩码,再重建成可交互的 4D 场景。
- 演示里可以直接问:
- “我想找一个舒服的地方坐”——沙发会被高亮
- “我需要白板”——白板被定位出来
- “有显示器可以用吗?”——显示器被标出
- “我同事在哪?”——系统能对人进行空间指认
- 这类能力的含义是:过去拍下来的每段视频,都可能变成可搜索的数据库,对机器人、AR/空间计算都有潜在价值。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11