谷歌 3PT 模型双 Transformer 统一检测分割与 6DoF 位姿,BOP 2025 夺冠
kscottz · x · 2026-08-27
Google Intrinsic 的 3PT(3D-Object Perception Transformer) 将检测、分割和 6DoF 位姿估计统一到两个仅用 RGB 的多视角 Transformer 中,在 ICCV 的 BOP 2025 挑战赛上以显著优势同时拿下 Industrial Robotics 和 AR/VR 两个赛道第一名,论文入选 CVPR 2026 Highlight。
模型展现出色的跨领域鲁棒性,目前已作为 Intrinsic Vision Model(IVM) 部署在全球真实的工业机器人工作站中。
OpenCV Live 第 222 期邀请论文作者之一 Agastya Kalra(Intrinsic/夏威夷大学)讲解 3PT 架构、BOP 2025 结果,以及模型从 benchmark 走向生产机器人的工程历程。
「具身」频道最新
- QNX 携手 Hailo 做边缘 Physical AI:性能一致性提升 14 倍 — pdamodaran · 2026-08-27
- 机器人护城河:数据、硬件与部署层的飞轮效应 — chris_j_paxton · 2026-08-27
- 端到端 RL 训练的通用无人机策略通过 sim2real — yacineMTB · 2026-08-27
- 长得像 Sony 随身听还会轮滑的机器人 — Thom_Wolf · 2026-08-27
- Waymo 与 Zoox 测试员因急刹致伤 — tbirdcymru · 2026-08-27
- 为何 LLM 难数窗户?Elorian CEO 论多模态推理 — bigdata · 2026-08-27