TrackCraft3R:将视频扩散Transformer改造为稠密3D追踪器
rsasaki0109 · x · 2026-08-15
KAIST和Google DeepMind的研究者提出TrackCraft3R,这是首个将视频扩散Transformer(video DiT)改造为前馈稠密3D追踪器的方法。给定单目视频及其帧锚定重建点图,TrackCraft3R在单次前向传播中预测参考锚定的追踪点图,该点图随时间跟踪第一帧的每个像素,并输出可见性。通过双潜表示等设计,解决了视频DiT的帧锚定公式与参考锚定追踪之间的不匹配。实验表明,该方法在真实世界视频上实现了最先进的稠密3D追踪性能。
「研究」频道最新
- Hugging Face 报告:中企开源模型规模已反超美国 — RisingSayak · 2026-08-15
- 研究揭秘Claude.md膨胀:删指令为何比加难 — 量子位 · 2026-08-15
- Insilico 推出虚拟衰老细胞平台,引入时间维度建模 — MaxUnfried · 2026-08-15
- 《AI 数理基础》书籍发布,带 AI 导师功能 — burkov · 2026-08-15
- NSF 2000 万美元建全美首个 AI 蛋白质工程云实验室 — MichaelCJewett · 2026-08-15
- GPU 程序搜索难在搜索空间巨大,需降维至抽象表示 — spikedoanz · 2026-08-15