CAIS 公开 EnigmaEval,Fable 5 领先,GPT-4o 仅 0.8
scaling01 · x · 2026-07-24
CAIS 宣布 EnigmaEval 现已公开,这是一个由长链路、复杂推理谜题组成的基准,原本往往需要多人团队耗费数小时甚至数天才能解开。
配图给出了多款前沿模型的结果:
- Fable 5 总分 41.3,排名第一
- GPT-5.6 Sol 为 39.2
- Gemini 3.1 Pro 为 32.4
- Kimi K3 为 23.6
- Grok 4.5 为 17.0
- Muse Spark 1.1 为 16.6
- GPT-4o 只有 0.8
第二张图进一步按难度拆分:在“hard”组里,题目被描述为需要 MIT 学生这类专家团队花几天才能做出的谜题,Fable 5 得分 10%,GPT-5.6 Sol 为 5.1%。
「研究」频道最新
- Cisco 开源 Antares 小模型,专做漏洞定位,参数只有 350M 到 3B — huggingface · 2026-07-24
- 斯坦福分析 5 亿字法规:加州行政报告要求 25 年激增 400% — StanfordHAI · 2026-07-24
- 一篇博客追问 OpenAI-Hugging Face 攻击是否意味着存在主义风险 — JeffLadish · 2026-07-24
- SN44 上线卡牌分级挑战,五项视觉指标单独评分 — bittingthembits · 2026-07-24
- IsomorphicLabs 称 AI 可改写药物发现的 Eroom 定律 — AllThingsApx · 2026-07-24
- 肌腱驱动机器人概念验证已跑通,还要测两种配置 — IanPritchard · 2026-07-24