TrackEverything:用 3D 场景去重打破点追踪长短视频两难
zhenjun_zhao · x · 2026-09-29
Meta 等机构的研究者发布 TrackEverything,一个面向长时程密集追踪的 3D 点追踪器。现有模型要么长时程只能追踪稀疏点,要么只能对全点做短片段追踪;该工作将视频表示为世界坐标系中的持久 3D 场景轨迹,让模型复杂度随场景独特几何而非帧数增长。
三项关键创新:
- 滑动窗口边界用体素化去重机制合并共位轨迹,避免同一表面对象重复累积;
- 将追踪分解为预测终点与动静分类的 endpoint refiner,再对动态点用轻量轨迹 refiner 解码密集轨迹;
- 提出 3D WAFT,用场景云中的高效特征采样替代内存开销巨大的 4D 相关体积。
据作者称这是首个能在超过 1 小时的视频中追踪所有可见点的 3D 追踪器。论文已上 arXiv。
所属事件:CMU 等发布 TrackEverything 实现长视频全点密集追踪(2 条相关)→
「具身」频道最新
- Meta Connect 黑客松:几个小时做出过去需团队数周的应用 — HarperSCarroll · 2026-09-29
- VLS 论文:免训练用 VLM 引导预训练机器人策略应对分布外场景 — micoolcho · 2026-09-29
- 哥斯达黎加野外机器人赛:机器狗边跑策略边防熊孩子 — micoolcho · 2026-09-29
- VkVIO:首个用 Vulkan 跨平台 GPU 加速的视觉惯性里程计 — zhenjun_zhao · 2026-09-29
- AI 机器人集成器:端到端完成 MicroFactory 整套部署 — ihorbeaver · 2026-09-29
- Meta 眼镜 Phoenix CAD 模型视频曝光,玩家盼开放 3D 文件自定义 — pvncher · 2026-09-29