ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4%
tencent · hf · 2026-07-24
ReferTrack 提出了一种用于具身视觉跟踪的 referring-then-tracking 范式。
- 任务场景是:移动机器人只依赖单个前向摄像头,根据自然语言描述持续跟踪指定目标。
- 模型先从一组带编号的检测框中选出目标,再在此基础上解码跟踪轨迹点。
- 为了保留目标运动线索,它维护一个滑动窗口,把历史框的几何信息通过 TVBI tokens 注入视觉历史。
- 论文还用自建的 Refer-QA 数据集联合训练,以增强目标识别能力。
在 EVT-Bench 上,作者报告了单目场景下的 SOTA:单目标、干扰、歧义三项划分分别达到 89.4% / 73.3% / 74.1% 的成功率。论文最后还提到,该方法已在四足机器人和人形机器人上做了真实部署,表现出不错的 sim-to-real 迁移能力。代码已开源。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11