CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack
cs.CV, cs.IR, cs.MM
2026-08-05
CLIP-CC-Bench 用 200 段 90 秒电影片段配专家段落参考,靠五个 embedding 裁判做粗细粒度匹配再 Borda 排序;17 个视频模型里 VideoLLaMA3 第一也只拿 0.67,长描述空间很大。
现在的视频语言模型(VLM)评测大多盯着短片段和单句指标(MSR-VTT、MSVD 这类),或者只做多选题问答(Video-MME)。但「能不能把一段一分钟的视频讲成一个连贯的段落故事」这件事几乎没人系统地评。现有指标也不顶用:BLEU、ROUGE、CIDEr 这类只看字面 n-gram 重叠,漏掉语义改写和叙事结构;LLM-as-judge 又是黑盒、打分不稳。CLIP-CC-Bench 就是来补这个空缺的。
数据上,作者从 5 小时电影里挑出 200 个 90 秒片段,每个配一段专家写的段落级参考描述,而且刻意去掉专有名词和文化梗,逼模型靠纯视觉理解而不是靠背过的关联。评测框架用 MTEB 榜单上五个最强的 embedding 模型当裁判(GTE-Qwen2-7B、KaLM-Gemma3-12B、Llama-Embed-Nemotron-8B、NV-Embed-v2、Qwen3-Embedding-8B),分两个粒度打分:粗粒度算整段的余弦相似度,细粒度按句子做贪心最佳匹配算 F1,两者取调和平均 HM-CF(只在一方面强会被拉低)。最后跨五个裁判做 Borda 投票排序,抵消单个裁判的尺度偏差。
17 个主流 VLM 上,VideoLLaMA3 拿满 Borda 分(80/80)、平均 0.67 排第一,mPLUG-Owl3(75,0.66)第二,LLaVA-OneVision 和 ViLAMP 并列第三(67,0.64),通用大模型 Qwen2.5-72B 和 32B 排第六、第七,垫底的 LongVA 只有 0.48。另有两个现象:一是所有模型粗粒度分都明显高于细粒度分(VideoLLaMA3 在 KaLM 上 0.82 对 0.76),说明它们抓得住大意、抓不住细节;二是头部也只有 0.67,长视频段落描述还有巨大提升空间。可靠性方面,五个裁判在系统级的 Spearman 相关在 0.96 到 0.99 之间,1000 次自助重采样后排序高度稳定(平均 Kendall τ 0.98,第一名 100% 保持),说明这套打分不是某个裁判的偶然产物。
长视频理解是 VLM 下半场的主战场,但缺一个靠谱的段落级评测就一直没法横向比。这个基准把「打分不稳」这个老问题用集成裁判、Borda 投票加自助稳定性检验给兜住了,给出来的排名因此比单裁判、单指标更可信。对选模型、做长视频模型的人来说,它直接给了一份可比的榜单和一个可复现的评测脚本。
作者自己承认:只有 200 个片段、规模有限;全是叙事电影,没覆盖教学、监控、UGC;只英文;每个片段只有一条参考描述,而描述同一画面的合理方式不止一种。方法论上,语义匹配不显式建模事件的时间或因果顺序,「讲对了事但顺序错」不会被惩罚。另外所有自动化分数还没有和大规模人工评分对齐过(作者把样本人评列为后续工作),外部效度仍待补。