ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4%

tencent · hf · 2026-07-24

ReferTrack 提出了一种用于具身视觉跟踪的 referring-then-tracking 范式。

在 EVT-Bench 上,作者报告了单目场景下的 SOTA:单目标、干扰、歧义三项划分分别达到 89.4% / 73.3% / 74.1% 的成功率。论文最后还提到,该方法已在四足机器人和人形机器人上做了真实部署,表现出不错的 sim-to-real 迁移能力。代码已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →