视觉逻辑评测:Gemini 领先,GPT 遭遇瓶颈
Afinetheorem · x · 2026-08-13
作者在自建的视觉与逻辑基准测试中发现,Grok 4.6 和 Qwen3.8 Max 表现平庸,成绩介于 Gemini 2.0 Flash Lite 和 GPT 5.6 Luna 之间。目前表现最好的依然是擅长此类任务的 Gemini 系列(如 Fable 和 Muse 1.2)。GPT 模型虽然也不错,但自一年多以前的 o3 版本以来就没有取得实质性进步。
「模型」频道最新
- 路透:谷歌 AI 领导层改组,布林敦促员工让 Gemini 重回前沿 — kenrickcai · 2026-08-13
- 学者批评前沿模型刻意隐藏推理细节,呼吁 AI 科学应保持开放 — rao2z · 2026-08-13
- 英伟达发布 Nemotron 3.5 Lightning 模型 — NVIDIAAI · 2026-08-13
- AI安全研究员吐槽:大厂首发模型卡常现低级拼写错误 — Miles_Brundage · 2026-08-13
- SemiAnalysis 炮轰英伟达:委员会式研发做不出前沿模型 — teortaxesTex · 2026-08-13
- 马斯克暗示 Grok 4.6 将至,称其实现帕累托最优 — shaunmmaguire · 2026-08-13