PlaylistEval:百小时视频下前沿评委模型成对准确率仅 75.4%

Shayekh Bin Islam · hf · 2026-09-30

PlaylistEval 提出无需人工标注的 agentic 框架,在 100 小时级播放列表上构建视频语言评委基准:自动生成受控差异的问答对(每对都需跨集合检索),共 630 对、覆盖 7 个领域,152 对分层子集与人类判断一致率 93.0%。评测 8 个家族 17 个全模态/多模态模型发现:前沿评委成对准确率仅 75.4%,开源评委差距更大;检索与最终判断都依赖多模态,且准确率随播放列表规模增长而下降。评测指出既有基准视频只有几分钟、很多答案可仅凭字幕区分,无法衡量日级长视频理解。管线与基准已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →