Seldon 推出 VGI-Bench:多模态模型仍远不及人类水平

bclavie · x · 2026-08-08

Seldon 发布了全新的多模态评测基准 VGI-Bench,旨在全面探查模型的 12 项视觉及音视觉能力。

该基准包含 550 道人工精心挑选的题目,旨在弥补现有视频基准测试的常见缺陷,并暴露当前 SOTA 模型在实际应用中的短板。测试结果显示,表现最好的模型得分仅为 64.73%,而人类得分达到 84.5%,显示模型在复杂多模态理解上仍有明显差距。

所属事件:Seldon推出VGI-Bench多模态评测基准(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →