Claude Fable 5.1 得分 81.9%,SimpleBench 原文显示仍未破人类基线
koltregaskes · x · 2026-09-06
有推文称 Claude Fable 5.1 成为首个超越人类基线的模型,但引用的 SimpleBench 官网原文给出相反数据:该基准上未受专门训练的人类基线为 83.7%,而包括当前最强模型 Claude Fable(81.9%)在内的所有已测 LLM 均未达到。SimpleBench 含 200+ 道选择题,考察时空推理、社交智能与语言对抗性(trick questions),样本中 9 名仅具高中学识的普通人即可跑赢所有前沿模型。此模型名称未经证实,且原推结论与其引用页面矛盾,建议以官方技术报告为准。
「模型」频道最新
- 用户称 GPT-6 Astra 五分钟找出 176 倍代码提速,另一人笑称自己代码无可优化 — ivan_bezdomny · 2026-09-06
- 博主称中国实验室已破解参数扩展,约需半年追平 Astra 级 — zephyr_z9 · 2026-09-06
- 数月数学证明工作,Astra 26分钟给出38页常数规模版本 — kfountou · 2026-09-06
- 实测 Astra:单文件 Minecraft 一次成型,145 分钟跑通完整世界模拟 — tegridyblues · 2026-09-06
- 推测算力被预训练占用,Claude 开发者体验持续恶化 — ATTlKA · 2026-09-06
- 普通用户盲测 Gemma 4 26B A4B,称与 SOTA 模型无感知差距 — TheMoonMidas · 2026-09-06