谷歌 3PT 模型双 Transformer 统一检测分割与 6DoF 位姿,BOP 2025 夺冠

kscottz · x · 2026-08-27

Google Intrinsic 的 3PT(3D-Object Perception Transformer) 将检测、分割和 6DoF 位姿估计统一到两个仅用 RGB 的多视角 Transformer 中,在 ICCV 的 BOP 2025 挑战赛上以显著优势同时拿下 Industrial Robotics 和 AR/VR 两个赛道第一名,论文入选 CVPR 2026 Highlight。

模型展现出色的跨领域鲁棒性,目前已作为 Intrinsic Vision Model(IVM) 部署在全球真实的工业机器人工作站中。

OpenCV Live 第 222 期邀请论文作者之一 Agastya Kalra(Intrinsic/夏威夷大学)讲解 3PT 架构、BOP 2025 结果,以及模型从 benchmark 走向生产机器人的工程历程。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →