Anthropic 发布 Fable 5.1:多项基准测试断层领先
AGI Hunt · wechat · 2026-09-02
Anthropic 发布 Fable 5.1 和 Mythos 5.1 模型。
性能提升
- 科研:Terminal-Bench-Science 0.1 得分 52.6%(前代 24.7%)。
- 编程:Terminal-Bench 4.0 得分 56%,Mythos 5.1 达 61%;CursorBench 3.2.0 得分 73.4%。
- 推理:Humanity's Last Exam 无工具得分 60.9%。
- 计算机操作:OSWorld 2.0 strict 得分 41.7%。
- 自动化:AutomationBench 得分 31.4%。
PreservedThinking
- 新增防蒸馏保护,校验 thinking block 的上下文完整性。若上下文被篡改,API 将报错或丢弃 thinking block(取决于模式)。
- 限制仅适用于 2026 年 8 月 31 日后新创建的 API 账号,老账号有缓冲期。
所属事件:Anthropic 发布 Fable 5.1,缓存降价 75%(72 条相关)→
「模型」频道最新
- 开发者实测:Anthropic 5.1 是跨越式升级 — doodlestein · 2026-09-02
- Fable 5.1 测试翻车:效果未达预期 — Angaisb_ · 2026-09-02
- Claude Fable 5.1 强悍演示:一句话生成马里奥赛车游戏 — ezshine · 2026-09-02
- Gemini 3.7 Flash 展示智能体视频理解能力 — otarU · 2026-09-02
- OpenAI Astra 在 ExploitBench 漏洞利用测试中达 100% 成功率 — JiaweiLiu_ · 2026-09-02
- 实测 Claude Fable 5.1:Max 模式下的“鹈鹕骑行” SVG — Simon Willison · 2026-09-02