CAIS 公开 EnigmaEval,Fable 5 领先,GPT-4o 仅 0.8

scaling01 · x · 2026-07-24

CAIS 宣布 EnigmaEval 现已公开,这是一个由长链路、复杂推理谜题组成的基准,原本往往需要多人团队耗费数小时甚至数天才能解开。

配图给出了多款前沿模型的结果:

第二张图进一步按难度拆分:在“hard”组里,题目被描述为需要 MIT 学生这类专家团队花几天才能做出的谜题,Fable 5 得分 10%,GPT-5.6 Sol 为 5.1%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →