ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4%
tencent · hf · 2026-07-24
ReferTrack 提出了一种用于具身视觉跟踪的 referring-then-tracking 范式。
- 任务场景是:移动机器人只依赖单个前向摄像头,根据自然语言描述持续跟踪指定目标。
- 模型先从一组带编号的检测框中选出目标,再在此基础上解码跟踪轨迹点。
- 为了保留目标运动线索,它维护一个滑动窗口,把历史框的几何信息通过 TVBI tokens 注入视觉历史。
- 论文还用自建的 Refer-QA 数据集联合训练,以增强目标识别能力。
在 EVT-Bench 上,作者报告了单目场景下的 SOTA:单目标、干扰、歧义三项划分分别达到 89.4% / 73.3% / 74.1% 的成功率。论文最后还提到,该方法已在四足机器人和人形机器人上做了真实部署,表现出不错的 sim-to-real 迁移能力。代码已开源。
「具身」频道最新
- REK 在东京对战夜前放出武士机器人热身视频 — cixliv · 2026-07-24
- SAGE 生成可仿真 3D 场景并开源 1 万条具身数据集 — rsasaki0109 · 2026-07-24
- 清华团队用 AutoMIA 把两张图变成可 3D 打印的镜像错觉艺术 — 新智元 · 2026-07-24
- IGGT4D 把流式 4D 实例几何带进动态场景理解 — zhenjun_zhao · 2026-07-24
- GLAM-SLAM 结合 ORB-SLAM2 与 Gaussian mapping 做实时大规模重建 — zhenjun_zhao · 2026-07-24
- MIT 报道:核电站正走向有人监督的自主控制 — nordicinst · 2026-07-24