Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan
cs.CV
2026-08-28
先定事件时间再并行吐出所有框。相对文本自回归,tube完成延迟降79倍、出框吞吐升92倍,4B骨干在VidSTG上超过多数7B方案。
时空视频定位要同时回答两件事:查询描述的事件从哪一帧开始、到哪一帧结束;以及这段时间里目标在每一帧的框。多模态大模型如果把整条时空轨迹当成文本逐 token 吐出来,解码深度会随框数线性涨,前一帧的坐标误差还会顺着轨迹往后传。很多强方法干脆把空间定位甩给检测头、外挂检测器或跟踪管线,语言模型只负责语义和时间。统一生成接口保住了,延迟和误差传播也一起留下。
问题不在任务本身。某一帧的正确框由查询和该帧画面决定,不该依赖已经吐出的前几个框。论文用一次干预实验验证了这件事:把顺序块解码里一个错框换成真值,后面近邻框的 IoU 会立刻回升,距离越远效果越弱。
Parallel Tube Decoding(PTD)把生成拆成两轮固定深度。第一轮出一个时间块,给出起止时刻。第二轮按这个区间实例化各时刻的时间锚点,所有空间块一起解码。顺序深度固定为 1+1,跟 tube 长度无关。更长的轨迹只加宽并行宽度,不加解码轮数。
对照四档解码:未量化文本坐标;量化成离散时空 token,深度是 4+7T;顺序块解码把一个框当成一个块,深度是 1+T;PTD 再把跨框依赖去掉。
为了让空间块能并行,Decoupled Block Attention 规定:每个空间块能看共享的视频-查询前缀和时间块,块内双向注意,块与块之间互不可见。训练时同一条样本同时走 next-token 和 multi-token 两条目标,免得并行解码把模型原本的自回归能力冲掉。
监督之后再用 GRPO。时间奖励是预测区间与真值的 tIoU;空间奖励在时间交集上算 GIoU 减去 L1,专门收拾框偏、框松、慢慢漂到旁边物体这几类错。两项等权相加。骨干是 Qwen3-VL-4B,词表加 1001 个空间 token 和 100 个时间 token。SFT 用 VidSTG 与 HC-STVG 约 9 万条;GRPO 从中筛出组内质量差异大的 1.6 万条,避免全对或全错的样本没有相对信号。
效率在单卡 MI210、batch 为 1 上测,只计解码、不计预填充。
| 解码 | TCL(秒) | BPS | 陈述句 mtIoU / vIoU |
| 未量化自回归 | 31.6 | 0.5 | 42.8 / 27.4 |
| 量化 token | 9.1 | 1.5 | 43.3 / 28.7 |
| 顺序块解码 | 1.0 | 8.8 | 47.2 / 31.2 |
| PTD | 0.4 | 45.9 | 47.5 / 32.9 |
相对未量化,tube 完成延迟约 79 倍、出框吞吐约 92 倍。tube 从 8 框拉到 64 框时,PTD 只从 0.33 秒涨到 0.40 秒,顺序块从 0.72 秒涨到 6.18 秒。
完整训练后,GRPO(PTD)在 VidSTG 陈述句上 mtIoU 53.7、mvIoU 38.3,超过 7B 的 Bridge-STG(52.6 / 37.2)。疑问句 mtIoU 52.2,也高于 Bridge-STG 的 50.1;[email protected] 则是 30.3 对 31.2,这一格没赢。HC-STVG v1 的 mvIoU 到 45.6,高于 STVG-o1 的 44.1,时间 mtIoU 59.4 略低于对方的 60.3。论文自己的口径是八项里赢七项。
零样本迁移更能说明定位习惯有没有泛化。Charades-STA mIoU 52.4,此前零样本最强 DEViL 是 47.7;ActivityNet 44.6,VideoChat-R1.5 是 35.5。ReXTime 上证据区间 mIoU 47.8,零样本最强 VideoTG-R1 只有 32.2,答题准确率 73.1 略低于对方的 75.7。接 SAM2 做指代跟踪,Ref-DAVIS 的 J&F 到 81.9,超过微调过的 Molmo2-4B 的 73.5。
这是对「视频定位必须串行出框」的一次否决。统一生成接口可以留下,不必外挂检测-跟踪。4B 骨干、没有专用空间模块,就打进 7B 管线的区间。延迟几乎不随 tube 变长,长视频检索和边看边定位更用得上。zero-shot 跟到时间定位、带证据的 VideoQA 和跟踪,说明学到的是可迁移的定位习惯,不只是两个训练集上的过拟合。
对要在 MLLM 里保留原生坐标接口的人,先把跨框因果依赖拿掉,比再叠一个外挂解码器更划算。
论文自己画了失败样例:遮挡后重认、小而快的目标框会飘;短促、边界含糊的状态切换会让时间区间提前结束或拖长。现有 STVG 标注默认单段连续时间和单条 tube,多段事件、镜头一转目标出画、同一指代对应多个实例都没覆盖。稠密 tube 数据也主要就 VidSTG 和 HC-STVG。效率数字来自一张 MI210,换 CUDA 卡不能直接套 79 倍这个倍数。零样本跟踪还要接 SAM2 或 SAM3 出 mask,模型自己吐的是框。疑问句 [email protected] 没有超过 Bridge-STG,空间精度在严格阈值下仍有缺口。