视觉逻辑评测:Gemini 领先,GPT 遭遇瓶颈

Afinetheorem · x · 2026-08-13

作者在自建的视觉与逻辑基准测试中发现,Grok 4.6 和 Qwen3.8 Max 表现平庸,成绩介于 Gemini 2.0 Flash Lite 和 GPT 5.6 Luna 之间。目前表现最好的依然是擅长此类任务的 Gemini 系列(如 Fable 和 Muse 1.2)。GPT 模型虽然也不错,但自一年多以前的 o3 版本以来就没有取得实质性进步。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →