Claude Fable 5.1 得分 81.9%,SimpleBench 原文显示仍未破人类基线

koltregaskes · x · 2026-09-06

有推文称 Claude Fable 5.1 成为首个超越人类基线的模型,但引用的 SimpleBench 官网原文给出相反数据:该基准上未受专门训练的人类基线为 83.7%,而包括当前最强模型 Claude Fable(81.9%)在内的所有已测 LLM 均未达到。SimpleBench 含 200+ 道选择题,考察时空推理、社交智能与语言对抗性(trick questions),样本中 9 名仅具高中学识的普通人即可跑赢所有前沿模型。此模型名称未经证实,且原推结论与其引用页面矛盾,建议以官方技术报告为准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →