Video-LLM能认出缺的中间段,TempCloze显示时间对齐才是瓶颈

TempCloze: Can Video-LLMs Identify the Missing Middle?

Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du

EMNLP 2026 Findings

cs.CV, cs.AI

2026-09-02

港大、国大、北大提出视频填空基准TempCloze:只给片头片尾,从四个候选里找出真正的中间段。31个Video-LLM里,语义和过程尚可,时间对齐才是主瓶颈。

这篇在解决什么

现有 Video-LLM 时间推理评测大多走语言:选文字选项,或写一段描述。选项措辞、答案相关、语言模型先验都能当捷径。有研究甚至显示,纯语言模型在不看视频的情况下也能把随机基线抬高 25% 以上。

港大、新加坡国大、北大把问题收成一次视觉填空。只给一段视频的开头和结尾,从四个候选片段里找出真正缺掉的中间。正确答案不只是「看起来相关」,还要卡在两个可见端点之间的正确时间位置。候选全部来自同一条源视频,场景和物体共享,逼模型比时间,而不是认物体。

方法

TempCloze 从七个公开源筛出 1,521 条视频,以长镜头和第一人称为主:LVD-2M 515、EgoLife 437、MiraData 198、FAVOR 145,其余来自 CaReBench、Video-TT、Daily-Omni。时长中位 30.0 秒、均值 31.3 秒。先按 12–90 秒和稠密字幕用 GPT-o3 丢掉不适合填空的样本,再按码率、清晰度和 Farnebäck 光流去掉几乎静止的片段。中间缺口取时间轴中央 50% 里、占总长 20%–40% 的一段,两边都留上下文。

每个视频沿三个维度各做一次四选一,干扰项也来自同一条视频:

默认每个片段均匀采 16 帧,六个片段共 96 帧。另做了边界帧 sanity check,避免模型靠端点像素对答案。人工基线在随机 100 条上测,三维分别 96%、98%、97%,均值 97%。

结果

10 个闭源、21 个开源模型。随机四选一是 25%。

模型SemanticAlignmentProgression均值
人类(100 条)96.0098.0097.0097.00
Seed1.8(think)95.0776.9293.7588.58
Qwen3.5-Plus(think)90.7276.3290.2085.74
Gemini 2.5 Pro(think)90.3366.6767.7874.92
GPT-5.468.1137.4165.1556.89
Qwen3.5-397B-A17B75.9450.6278.2468.27
闭源平均70.7348.1367.7262.19
开源平均34.0026.5436.9732.51
Grok 4.124.5224.0623.7324.11

对齐是主瓶颈。最强闭源 Seed1.8 的 Alignment 仍只有 76.92,离人类 98 差一截;最强开源 Qwen3.5-35B 也只有 51.55。三条全对(3/3)闭源平均 33.24%、开源 7.15%,人类 92%。Seed1.8 关掉 think,Alignment 从 76.92 掉到 61.93。Grok 4.1 三维都贴着 25% 的随机线。

错误有结构。Alignment 里最常见的是 Expanded:内容对,区间向两边胀出去,Seed1.8-I 的对齐错误里 75% 选了它。Progression 里最常见的是 Reversed,GPT-5.4 的过程错误里 67% 选倒放。混维子集 TempCloze-Mixed 上,对齐干扰项拿走最多误选。

行为也很脆。Hard 子集上打乱选项顺序,准确率波动不到 4 点,但选中的片段会变(CFR 32.4%–60.7%)。模型更吃开头、更弱于从结尾往回推:Seed1.6 的 Progression,只给开头约 80%,只给结尾掉到 46%。可见跨度拉长、帧密度从 8 提到 20,对齐分数反而掉,端点附近的证据被稀释。test-time scaling 能抬绝对分,维之间的相对顺序不变,对齐仍最难。

为什么重要

这是一条少走语言捷径的时间推理尺子。谁若只报 VideoQA 总分,很容易把「认得事件」和「卡得准时间」混在一起。要对齐做专项,需要更稳的边界表示,以及同时用上前后上下文,而不是只会顺着开头往后续。

从业者若在做视频定位、长镜头剪辑或第一人称助手,别默认「更强的 Video-LLM 已经懂时间」。在这条尺子上,多数开源 7B–8B 仍在随机附近。

局限与存疑

这是受控诊断,不是全面视频理解测试。不覆盖开放生成、对话叙事、音频线索和自由未来预测。固定候选意味着分数相对这套干扰项成立,不能直接外推到自由推理。同源候选让任务更严,对齐干扰项可以「内容合理但区间不对」,这是设计如此。视频偏长镜头和第一人称,API 与解码行为也会变,结果是当前模型的一张快照。人类基线只测了 100 条。

术语

原文与代码

相关论文

全部论文解读