视觉与逻辑任务实测:Gemini 表现领先且逼近 50% 准确率
Afinetheorem · x · 2026-08-14
作者指出,尽管外界评价不一,但在视觉结合逻辑的任务(尤其是视频理解)上,Gemini 依然是当前表现最好的模型,且性价比极高。目前已有模型在该类测试中接近 50% 的 pass@1 准确率,部分案例的精确匹配率甚至达到 73%。
所属事件:视觉逻辑评测显示 Gemini 领先 GPT(2 条相关)→
「模型」频道最新
- DeepSeek 无法看图?用户惊叹其绕过限制的极客操作 — chris_j_paxton · 2026-08-14
- dots3-note多模态模型发布:280B参数支持512K上下文 — jacek2023 · 2026-08-14
- AI 圈热议:Google DeepMind 模型表现超预期引发不适 — intellectronica · 2026-08-14
- 预测市场押注 OpenAI “Astra”下月发布概率达 76% — Polymarket · 2026-08-14
- Anthropic 开始为 Claude 输出添加水印 — matthew_d_green · 2026-08-14
- 研究:模型越大越难解释并非定局,Steerling-8b 实现高可解释性 — juliusadml · 2026-08-14