Anthropic 发布 Claude Fable:Terminal-Bench 评测得分翻倍
BenBlaiszik · x · 2026-09-02
Anthropic 宣布新模型 Claude Fable 发布。在基准测试中,该模型树立了新标准:
- 在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多。
- 在 Terminal-Bench 4.0 上得分 55.8%,而 Fable 5 为 42.0%。
所属事件:Anthropic发布Claude Fable 5.1与Mythos 5.1,缓存降价75%(35 条相关)→
「模型」频道最新
- Fable 5.1 系统卡曝光:隐匿率史上最高,Anthropic 下调灾难风险评级 — rohanpaul_ai · 2026-09-02
- Fable 模型视觉逻辑实测:78 分破纪录但仍漏 CAD 错误 — Afinetheorem · 2026-09-02
- 实测者称 Fable 5.1 视觉+逻辑登顶,私测逻辑基准 78 分破纪录 — Afinetheorem · 2026-09-02
- Muse Spark 1.2 写作能力评测:自然度超越当前主流模型 — intellectronica · 2026-09-02
- Qwen 团队发电商 Agent 基准:18 个前沿模型跑全年模拟无一家全面领先 — dair_ai · 2026-09-02
- 技巧展示:通过放置图像诱使 Atlas 生成 3D 场景 — toptickcrypto · 2026-09-02