CLIP-CC-Bench:专测视频大模型长文本描述能力的新基准
MINT-SDSU · hf · 2026-08-11
现有视频语言模型的评测多集中于短视频片段和单句指标,为了填补长文本描述能力的评测空白,研究人员推出了 CLIP-CC-Bench。
该基准的核心特点与评测机制如下:
- 数据构建:基于 5 小时的电影内容,将其切分为 90 秒的片段,并为每个片段配备专家撰写的段落级参考描述。
- 评测方法:采用 5 种先进的 LLM 嵌入模型集成,以降低单一模型偏差。通过粗粒度与细粒度两种语义匹配方法,对比模型生成描述与参考文本。
- 实测结果:在此框架下评测了 17 个当前主流的视频语言模型,并公布了 Borda 聚合排名与平均分。同时通过评估内部一致性和自举排名稳定性验证了协议的可靠性。
研究团队已开源评测脚本、模型输出与聚合工具以支持复现。
「多模态」频道最新
- Minimax H3模型实测:突破15秒限制,生成质量与连贯性俱佳 — tsi_org · 2026-08-11
- 实测 MiniMax 音乐模型:仅凭文字提示精准模仿指定歌手 — elfpresetsv3 · 2026-08-11
- Krea 2 实测:老显卡极速生成,人物真实度与提示词遵循双优 — Arbellis · 2026-08-11
- Suno 水印机制遭质疑:或迫使传统音乐人寻找替代品 — koltregaskes · 2026-08-11
- RTX 5090 对决双卡 48GB:本地 AI 视频生成硬件升级指南 — Ammoryyy · 2026-08-11
- 用 Dreamina 制作心理恐怖短片:克制音效是关键 — Eric520CC · 2026-08-11