Claude Fable 5.1 登顶 ARC-AGI-2:90% 得分、单任务成本 $4.49
geoffwolfe · x · 2026-09-19
- ARC Prize 官方页面显示,Claude Fable 5.1 在最大推理强度下于 ARC-AGI-1 Semi-Private 拿到 97.5%(单任务 $1.40),ARC-AGI-2 Semi-Private 拿到 90.0%(单任务 $4.49)。
- 该模型提供 5 档推理强度,ARC-AGI-2 上从 Low 的 78.3% 到 Max 的 90.0%,分数随推理预算稳步上升;ARC-AGI-1 几近饱和(90.0%→97.5%)。
- 榜单还列有 DeepSeek V4、Gemini 3.x、GPT-5.6/6、Grok 4.x、Kimi K3 等多个变体的已验证成绩。
- 评论者指出,ARC-AGI-2 已成为「分数+成本」双维基准,剩余信号集中在仍能区分推理努力、一致性与推理预算的困难尾部任务上。
「模型」频道最新
- 网友质疑 Codex 用户被「坑」,指其用量与宣传不符 — AIFlow_ML · 2026-09-19
- 阶跃 Step 5 Preview 亮相 AA:44 分、1M 上下文、$1/1M 输入 — teortaxesTex · 2026-09-19
- 开发者吐槽 Codex 现有用量限制下“不可持续” — AIFlow_ML · 2026-09-19
- Cognition 发布 SWE-2 编码模型:距 Fable 5.1 仅 1 分,便宜 64% — AxSaucedo · 2026-09-19
- Jev 两日狂揽 3600 万播放,社区已克隆出 6 个开源版本 — Latent Space · 2026-09-19
- 被赞为最佳解释的 Jev 梗:大量用例的关键解锁 — Roger_M_Taylor · 2026-09-19