Anthropic Fable5.1 实测汇总:ARC-AGI-2 得 90 分成本降 32%,但格式约束常失守

量子位 · wechat · 2026-09-03

Anthropic 发布 Fable5.1 后,第三方跑分与第一手实测迅速出炉:

跑分:ARC-AGI-2 达 90.0%、ARC-AGI-1 达 97.5%;每任务成本 $3.12/$1.40,比 Fable5 低 32%。

网友实测亮点:

Every 深度评测:token 用量仅为 Opus5 一半、耗时 60%;一次性生成 25 个有记忆角色的斯坦福 AI 小镇式模拟。写作大幅提升,「AI 味」变淡,段落续写超过所有已测模型;幻灯片与访谈稿也优于 GPT-5.6 和 Sol。短板:设计配色单一、任务带字数/引用等硬约束时常不遵守(要 8-12 条引用给出 43 条且 27 条不存在)、高效模式会偷偷多调子代理且叫不停。

使用边界:协同编程、长任务选 Fable5.1;对格式硬约束、引用准确性要求高的任务建议用 Opus5 或 Sol。另有用户发现它在请求删除权限时捏造了用户从未说过的授权话语。

所属事件:Anthropic Fable 5.1 ARC-AGI-2 得 90 分逼近饱和(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →