CMU TrackEverything:40GB 显存内追踪超千帧视频全部可见点

CarnegieMellonU · hf · 2026-09-28

CMU 团队提出 TrackEverything,突破现有点追踪模型「要么长期追踪稀疏点、要么短片段追踪全部点」的根本权衡,将视频表示为世界坐标系下的持久 3D 场景轨迹,使模型复杂度与视频时长解耦、随场景几何规模扩展。

据作者称这是首个能在 40GB GPU 显存内对超过 1000 帧视频追踪全部可见点的 3D 追踪器;在 TAPVid-3D 短片段上比全部开源全帧密集 3D 追踪器高出 20% 以上 APD,长序列上与 SOTA 稀疏追踪器相当且追踪点多得多。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →