TempCloze: Can Video-LLMs Identify the Missing Middle?
Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du
EMNLP 2026 Findings
cs.CV, cs.AI
2026-09-02
港大、国大、北大提出视频填空基准TempCloze:只给片头片尾,从四个候选里找出真正的中间段。31个Video-LLM里,语义和过程尚可,时间对齐才是主瓶颈。
现有 Video-LLM 时间推理评测大多走语言:选文字选项,或写一段描述。选项措辞、答案相关、语言模型先验都能当捷径。有研究甚至显示,纯语言模型在不看视频的情况下也能把随机基线抬高 25% 以上。
港大、新加坡国大、北大把问题收成一次视觉填空。只给一段视频的开头和结尾,从四个候选片段里找出真正缺掉的中间。正确答案不只是「看起来相关」,还要卡在两个可见端点之间的正确时间位置。候选全部来自同一条源视频,场景和物体共享,逼模型比时间,而不是认物体。
TempCloze 从七个公开源筛出 1,521 条视频,以长镜头和第一人称为主:LVD-2M 515、EgoLife 437、MiraData 198、FAVOR 145,其余来自 CaReBench、Video-TT、Daily-Omni。时长中位 30.0 秒、均值 31.3 秒。先按 12–90 秒和稠密字幕用 GPT-o3 丢掉不适合填空的样本,再按码率、清晰度和 Farnebäck 光流去掉几乎静止的片段。中间缺口取时间轴中央 50% 里、占总长 20%–40% 的一段,两边都留上下文。
每个视频沿三个维度各做一次四选一,干扰项也来自同一条视频:
默认每个片段均匀采 16 帧,六个片段共 96 帧。另做了边界帧 sanity check,避免模型靠端点像素对答案。人工基线在随机 100 条上测,三维分别 96%、98%、97%,均值 97%。
10 个闭源、21 个开源模型。随机四选一是 25%。
| 模型 | Semantic | Alignment | Progression | 均值 |
| 人类(100 条) | 96.00 | 98.00 | 97.00 | 97.00 |
| Seed1.8(think) | 95.07 | 76.92 | 93.75 | 88.58 |
| Qwen3.5-Plus(think) | 90.72 | 76.32 | 90.20 | 85.74 |
| Gemini 2.5 Pro(think) | 90.33 | 66.67 | 67.78 | 74.92 |
| GPT-5.4 | 68.11 | 37.41 | 65.15 | 56.89 |
| Qwen3.5-397B-A17B | 75.94 | 50.62 | 78.24 | 68.27 |
| 闭源平均 | 70.73 | 48.13 | 67.72 | 62.19 |
| 开源平均 | 34.00 | 26.54 | 36.97 | 32.51 |
| Grok 4.1 | 24.52 | 24.06 | 23.73 | 24.11 |
对齐是主瓶颈。最强闭源 Seed1.8 的 Alignment 仍只有 76.92,离人类 98 差一截;最强开源 Qwen3.5-35B 也只有 51.55。三条全对(3/3)闭源平均 33.24%、开源 7.15%,人类 92%。Seed1.8 关掉 think,Alignment 从 76.92 掉到 61.93。Grok 4.1 三维都贴着 25% 的随机线。
错误有结构。Alignment 里最常见的是 Expanded:内容对,区间向两边胀出去,Seed1.8-I 的对齐错误里 75% 选了它。Progression 里最常见的是 Reversed,GPT-5.4 的过程错误里 67% 选倒放。混维子集 TempCloze-Mixed 上,对齐干扰项拿走最多误选。
行为也很脆。Hard 子集上打乱选项顺序,准确率波动不到 4 点,但选中的片段会变(CFR 32.4%–60.7%)。模型更吃开头、更弱于从结尾往回推:Seed1.6 的 Progression,只给开头约 80%,只给结尾掉到 46%。可见跨度拉长、帧密度从 8 提到 20,对齐分数反而掉,端点附近的证据被稀释。test-time scaling 能抬绝对分,维之间的相对顺序不变,对齐仍最难。
这是一条少走语言捷径的时间推理尺子。谁若只报 VideoQA 总分,很容易把「认得事件」和「卡得准时间」混在一起。要对齐做专项,需要更稳的边界表示,以及同时用上前后上下文,而不是只会顺着开头往后续。
从业者若在做视频定位、长镜头剪辑或第一人称助手,别默认「更强的 Video-LLM 已经懂时间」。在这条尺子上,多数开源 7B–8B 仍在随机附近。
这是受控诊断,不是全面视频理解测试。不覆盖开放生成、对话叙事、音频线索和自由未来预测。固定候选意味着分数相对这套干扰项成立,不能直接外推到自由推理。同源候选让任务更严,对齐干扰项可以「内容合理但区间不对」,这是设计如此。视频偏长镜头和第一人称,API 与解码行为也会变,结果是当前模型的一张快照。人类基线只测了 100 条。