Anthropic 发布 Fable 5.1:多项基准测试断层领先
AGI Hunt · wechat · 2026-09-02
Anthropic 发布 Fable 5.1 和 Mythos 5.1 模型。
性能提升
- 科研:Terminal-Bench-Science 0.1 得分 52.6%(前代 24.7%)。
- 编程:Terminal-Bench 4.0 得分 56%,Mythos 5.1 达 61%;CursorBench 3.2.0 得分 73.4%。
- 推理:Humanity's Last Exam 无工具得分 60.9%。
- 计算机操作:OSWorld 2.0 strict 得分 41.7%。
- 自动化:AutomationBench 得分 31.4%。
PreservedThinking
- 新增防蒸馏保护,校验 thinking block 的上下文完整性。若上下文被篡改,API 将报错或丢弃 thinking block(取决于模式)。
- 限制仅适用于 2026 年 8 月 31 日后新创建的 API 账号,老账号有缓冲期。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- Anthropic 指控 Moonshot 与 DeepSeek 偷偷用 Claude 服务自家用户 — ns123abc · 2026-09-12
- LightSpeed 播客:GPT-6 Astra 推理链可绕过部分监控,审计力成新卖点 — buckymoore · 2026-09-12
- OpenAI 图像生成输出格式不可控,预览图常比成图更好 — No_Body_4834 · 2026-09-12
- 用户报告 Gemini Pro 3.1 突然拒绝回答简单请求 — kostaslamprou · 2026-09-12
- 初创公司用 GPT-6 Astra 打造无人机,一张照片即可锁定追踪特定人 — Polymarket · 2026-09-12
- 397B 多模态新模型 Nex-N2.5 Pro 上架 OpenRouter,主打 Computer Use — nikola_mr64990 · 2026-09-12