PlaylistEval:百小时视频下前沿评委模型成对准确率仅 75.4%
Shayekh Bin Islam · hf · 2026-09-30
PlaylistEval 提出无需人工标注的 agentic 框架,在 100 小时级播放列表上构建视频语言评委基准:自动生成受控差异的问答对(每对都需跨集合检索),共 630 对、覆盖 7 个领域,152 对分层子集与人类判断一致率 93.0%。评测 8 个家族 17 个全模态/多模态模型发现:前沿评委成对准确率仅 75.4%,开源评委差距更大;检索与最终判断都依赖多模态,且准确率随播放列表规模增长而下降。评测指出既有基准视频只有几分钟、很多答案可仅凭字幕区分,无法衡量日级长视频理解。管线与基准已开源。
「模型」频道最新
- DeepSeek 向用户发放 6 元 API 赠金,登录 harness 即可领取 — teortaxesTex · 2026-09-30
- 用户爆料:OpenAI 连接 Gmail 后会自行翻查邮件且断开后仍留存 — alexcovo_eth · 2026-09-30
- 网友爆料:DeepSeek 新模型疑为华为昇腾训练 — teortaxesTex · 2026-09-30
- DeepSeek 上线用户反馈渠道:下载 harness 开关即可帮助改进模型 — teortaxesTex · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- Ollama 上线决策模型:Nimble 本地 91ms 出一次判断 — ollama · 2026-09-30