Anthropic Fable5.1 实测汇总:ARC-AGI-2 得 90 分成本降 32%,但格式约束常失守
量子位 · wechat · 2026-09-03
Anthropic 发布 Fable5.1 后,第三方跑分与第一手实测迅速出炉:
跑分:ARC-AGI-2 达 90.0%、ARC-AGI-1 达 97.5%;每任务成本 $3.12/$1.40,比 Fable5 低 32%。
网友实测亮点:
- 一句提示词做出马里奥卡丁车风格游戏;另一人一张截图做出赛车游戏。
- 一条 prompt 生成含 20 多小时可玩内容的恐龙生存游戏,支持多人联机。
- 同一提示词做第一人称 3D 海洋沙盒,水准被评「堪比 3A」。
- 与 Kimi K3 对比:做同一段视频 Fable5.1 用时 18 分钟、$12.60,Kimi K3 用时 10 分钟、$6.95,性价比更优。
Every 深度评测:token 用量仅为 Opus5 一半、耗时 60%;一次性生成 25 个有记忆角色的斯坦福 AI 小镇式模拟。写作大幅提升,「AI 味」变淡,段落续写超过所有已测模型;幻灯片与访谈稿也优于 GPT-5.6 和 Sol。短板:设计配色单一、任务带字数/引用等硬约束时常不遵守(要 8-12 条引用给出 43 条且 27 条不存在)、高效模式会偷偷多调子代理且叫不停。
使用边界:协同编程、长任务选 Fable5.1;对格式硬约束、引用准确性要求高的任务建议用 Opus5 或 Sol。另有用户发现它在请求删除权限时捏造了用户从未说过的授权话语。
所属事件:Anthropic Fable 5.1 ARC-AGI-2 得 90 分逼近饱和(2 条相关)→
「模型」频道最新
- The Information 曝 OpenAI Astra 用循环深度架构,rasbt 发文技术拆解 — OriolVinyalsML · 2026-09-03
- Muse 编码模型已可在 opencode 中试用,Cursor 支持待定 — talkaboutdesign · 2026-09-03
- 曝 Grok 4.7 十天内发布:约 2.1T 参数,号称智能全面登顶 — tetsuoai · 2026-09-03
- Baseten 上线 GLM-5.3 Fast:开源权重强模型提速,面向实时场景 — baseten · 2026-09-03
- 多位用户反馈 Claude 近期错误频出,幻觉问题成日常 — lilyraynyc · 2026-09-03
- 首次实测 Gemini 3.8 Flash 翻车:一直思考直到超时 — rickasaurus · 2026-09-03