新基准 Connections Eval 榜单:Grok 暂居首
aronchick · x · 2026-08-18
Matson 发布了基于 NYT Connections 谜题的新基准测试 Connections Eval 的结果。榜单涵盖了 42 个模型,采用 One-Shot 模式运行 20 局。
部分榜单结果:
- x-ai/grok-4.6: 91 分 (成本 $0.015/局)
- meta/muse-spark-1.1: 90 分 (成本 $0.021/局)
- google/gemini-3.1-pro-preview: 86 分 (成本 $0.021/局)
- openai/gpt-5.6-terra: 86 分 (成本 $0.024/局)
该基准侧重于模型在关联词语类谜题上的推理能力。
「模型」频道最新
- DeepSeek 测试称其平价 Flash 力压昂贵的 Pro — AccBalanced · 2026-08-18
- 推理模型难伺候?从 Opus 到 Gemma 都被喷 — MerePotato · 2026-08-18
- Gemini 3.7 Flash 上线,Box 与 Databricks 等已投入实战 — DynamicWebPaige · 2026-08-18
- 用户实测 Codex 消耗暴增:半天烧掉 15% 周额度 — GabGarrett · 2026-08-18
- Anthropic Mythos 2 训练完成但不发布,已启动 Mythos 3 — kimmonismus · 2026-08-18
- Qwen3.8-Max 惊现零样本实例分割能力 — iamrobotbear · 2026-08-18