视觉与逻辑任务实测:Gemini 表现领先且逼近 50% 准确率

Afinetheorem · x · 2026-08-14

作者指出,尽管外界评价不一,但在视觉结合逻辑的任务(尤其是视频理解)上,Gemini 依然是当前表现最好的模型,且性价比极高。目前已有模型在该类测试中接近 50% 的 pass@1 准确率,部分案例的精确匹配率甚至达到 73%。

所属事件:视觉逻辑评测显示 Gemini 领先 GPT(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →