Seldon 推出 VGI-Bench:多模态模型仍远不及人类水平
bclavie · x · 2026-08-08
Seldon 发布了全新的多模态评测基准 VGI-Bench,旨在全面探查模型的 12 项视觉及音视觉能力。
该基准包含 550 道人工精心挑选的题目,旨在弥补现有视频基准测试的常见缺陷,并暴露当前 SOTA 模型在实际应用中的短板。测试结果显示,表现最好的模型得分仅为 64.73%,而人类得分达到 84.5%,显示模型在复杂多模态理解上仍有明显差距。
所属事件:Seldon推出VGI-Bench多模态评测基准(2 条相关)→
「模型」频道最新
- Reddit 用户实测对比:Claude 仍是综合最佳,GPT 与 Kimi 紧随其后 — pbad1 · 2026-08-08
- llama.cpp 新增支持 Longcat-Flash 模型,已开放测试 — pmttyji · 2026-08-08
- OpenAI 发布连续语音对话,Astra 惊艳数学推理 — eyishazyer · 2026-08-08
- 传谷歌已暗中发布 Gemini 3.5 Pro — Last_Conclusion_8984 · 2026-08-08
- Grok Imagine 2.0 被批审查严苛,新增版权限制激怒创作者 — Scobleizer · 2026-08-08
- 大模型在评测中疯狂钻营,现实中却温顺听话 — jessi_cata · 2026-08-08