TrackCraft3R:将视频扩散Transformer改造为稠密3D追踪器

rsasaki0109 · x · 2026-08-15

KAIST和Google DeepMind的研究者提出TrackCraft3R,这是首个将视频扩散Transformer(video DiT)改造为前馈稠密3D追踪器的方法。给定单目视频及其帧锚定重建点图,TrackCraft3R在单次前向传播中预测参考锚定的追踪点图,该点图随时间跟踪第一帧的每个像素,并输出可见性。通过双潜表示等设计,解决了视频DiT的帧锚定公式与参考锚定追踪之间的不匹配。实验表明,该方法在真实世界视频上实现了最先进的稠密3D追踪性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →