ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang
cs.RO
2026-07-22
ReferTrack 把识别变成「选编号」多选题,单目 4B 模型在 EVT-Bench 干扰/歧义场景压过多摄像头基线。
具身视觉追踪(EVT):一个移动机器人,只用前置摄像头,跟着一段自然语言描述的目标走。近来的视觉-语言-动作(VLA)策略把「认出目标」和「规划轨迹」揉在一个模型里,听起来省事,但它的思维链推理发生在抽象的空间隐变量里,既难监督,又和画面里实际的检测框对不齐。结果是认错人,后面的跟踪全废。ReferTrack 把「认」和「跟」拆成两步,让识别这一步落回到图像空间的检测框上。
第一步是「指代」。模型先把当前帧里检测到的行人排成一个带编号的候选目录:⟨ped₁⟩…⟨pedK⟩,外加一个 ⟨NOEXIST⟩(目标不在画面里)。然后用一个 Refer-CoT token 选一个编号。识别就此变成一道受限的多选题,靠自回归 next-token 预测就能做,而且完全落在图像空间,可监督。
第二步是「跟踪」。选中的检测框作为条件,LLM 把 Refer-CoT token 当前缀,生成动作 token,再由一个 MLP 头解出 M 个航点。
为了不让目标在镜头切换或遮挡里丢掉,ReferTrack 维护一个先进先出的滑动窗口,缓存历史选中的检测框,经 MLP 嵌入后加到 TVBI token 上(ETvBi = ETvI + Pbbox(b))。当前帧只用 TVI、不注入当前框,逼着模型靠历史几何线索去锁定目标。识别能力还靠一个自建的 Refer-QA 数据集协同训练:把 2–3 个带描述的行人合成到不同背景上,监督模型选出对的编号或回答 NOEXIST。
ReferTrack 只用单前置摄像头、4B 参数、仅做 SFT。在 EVT-Bench 上:
| 划分 | 成功率 | 跟踪率 |
| 单目标(STT) | 89.4% | 92.5% |
| 干扰(DT) | 73.3% | 81.8% |
| 歧义(AT) | 74.1% | 85.7% |
亮点是用单目追平甚至超过多摄像头基线:干扰场景里 TrackVLA++ 只有 66.5%、NavFoM 62.0%,歧义场景里 TrackVLA++ 51.2%、CoMaTrack 57.5%,都被单目的 ReferTrack 压过。真机部署在 Unitree Go2 四足和 G1 人形上跑通,云 GPU 推理平均 10.6 Hz。
具身追踪的难点从来不在「怎么动」,而在「盯对人」。ReferTrack 用「先选框再跟」把识别变成可监督的多选题,这套范式对做具身跟随、机器人导航的团队是直接可用的工程参考,而且证明了单目加小模型(4B)在识别重的任务上能和多目方案掰手腕。
论文正文没单列局限,但 oracle 消融把底交了:给模型完美的检测框(oracle),干扰场景成功率从 73.3% 跳到 81.5%。瓶颈在识别、不在运动规划,而这恰恰是「指代」那步要继续啃的。另外 10.6 Hz 依赖云 GPU,本机部署能不能稳在这个频率没说;评测只在 EVT-Bench 上做,真实开放场景(光照、人群密度剧变)的鲁棒性还需更多验证。