CAIS 公开 EnigmaEval,Fable 5 领先,GPT-4o 仅 0.8
scaling01 · x · 2026-07-24
CAIS 宣布 EnigmaEval 现已公开,这是一个由长链路、复杂推理谜题组成的基准,原本往往需要多人团队耗费数小时甚至数天才能解开。
配图给出了多款前沿模型的结果:
- Fable 5 总分 41.3,排名第一
- GPT-5.6 Sol 为 39.2
- Gemini 3.1 Pro 为 32.4
- Kimi K3 为 23.6
- Grok 4.5 为 17.0
- Muse Spark 1.1 为 16.6
- GPT-4o 只有 0.8
第二张图进一步按难度拆分:在“hard”组里,题目被描述为需要 MIT 学生这类专家团队花几天才能做出的谜题,Fable 5 得分 10%,GPT-5.6 Sol 为 5.1%。
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11