视觉逻辑评测显示 Gemini 领先 GPT

在最新自建的视觉与逻辑基准测试中,Gemini 展现出显著优势,成为当前表现最好的模型,并在该类测试中逼近 50% 的 pass@1 准确率。相比之下,GPT 遭遇性能瓶颈,而 Grok 和 Qwen 的表现也较为平庸。作者指出,尽管外界评价不一,但在视频理解等视觉结合逻辑的任务上,Gemini 凭借极高的性价比依然稳居领先地位。

2026-08-13 ~ 2026-08-14 · 2 条相关