CMU TrackEverything:40GB 显存内追踪超千帧视频全部可见点
CarnegieMellonU · hf · 2026-09-28
CMU 团队提出 TrackEverything,突破现有点追踪模型「要么长期追踪稀疏点、要么短片段追踪全部点」的根本权衡,将视频表示为世界坐标系下的持久 3D 场景轨迹,使模型复杂度与视频时长解耦、随场景几何规模扩展。
- 体素去重:在滑动窗口边界用体素化机制合并同位置轨迹,避免同一表面被重复累积。
- 分解追踪:先用端点精化器预测每点去向及动静态分类,再仅对动态点解码轻量轨迹。
- 3D WAFT:用场景点云中的高效特征采样替代内存爆炸的 4D 相关体积。
据作者称这是首个能在 40GB GPU 显存内对超过 1000 帧视频追踪全部可见点的 3D 追踪器;在 TAPVid-3D 短片段上比全部开源全帧密集 3D 追踪器高出 20% 以上 APD,长序列上与 SOTA 稀疏追踪器相当且追踪点多得多。
「研究」频道最新
- Yoav Goldberg 质疑:新模型发布两周 arXiv 已涌现 29 篇论文 — yoavgo · 2026-09-28
- 数据效率被视为人类最后优势,但海量喂料仍是最便宜路径 — himanshustwts · 2026-09-28
- 北大与谷歌提出 Harness-Zero:把 Agent 框架蒸馏进模型权重 — AxSaucedo · 2026-09-28
- MultiFlow 用耦合流匹配预测单细胞多组学扰动响应 — burny_tech · 2026-09-28
- BRLabs 把「计算生命」自复制程序实验搬进浏览器并开源 — zzznah · 2026-09-28
- 耶鲁等团队发布 Pop-Corn,预测基因扰动对细胞群体构成的影响 — burny_tech · 2026-09-28