CLIP-CC-Bench:专测视频大模型长文本描述能力的新基准

MINT-SDSU · hf · 2026-08-11

现有视频语言模型的评测多集中于短视频片段和单句指标,为了填补长文本描述能力的评测空白,研究人员推出了 CLIP-CC-Bench。

该基准的核心特点与评测机制如下:

研究团队已开源评测脚本、模型输出与聚合工具以支持复现。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →