Anthropic 发布 Fable 5.1:Terminal-Bench-Science 分数翻倍,价格降25%
heathercmiller · x · 2026-09-02
- Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1(同一模型、不同安全护栏级别):Fable 5.1 正式可用,Mythos 5.1 仅限可信访问计划,面向网络安全与生命科学场景。
- 性能上,斯坦福牵头的 Terminal-Bench-Science 基准(评测科研工作流中的 AI agent,v0.1 含 70 个任务)显示成绩翻倍:Fable 5 为 24.7%,Fable 5.1 达 52.6%;该基准上线仅 5 天即成为发布页置顶基准。团队表示将构建更难的 v0.2。
- 价格:按 token 计费场景下典型工作负载比 Fable 5 便宜约 25%,主要来自缓存读取降价;高度 agentic 场景最高可省约 45%。
- 数据保留:新的 Enterprise Frontier Safeguards(EFS)让企业客户获得等同零数据保留的完全隐私,数据存储在客户自控的云基础设施中,今秋起分阶段推出;在此之前合格客户可直接以零数据保留使用。
- 安全护栏:误报显著下降,网络安全领域误报比之前减少 60%。
所属事件:Anthropic发布Claude Fable 5.1与Mythos 5.1,缓存降价75%(35 条相关)→
「模型」频道最新
- Fable 5.1 系统卡曝光:隐匿率史上最高,Anthropic 下调灾难风险评级 — rohanpaul_ai · 2026-09-02
- Fable 模型视觉逻辑实测:78 分破纪录但仍漏 CAD 错误 — Afinetheorem · 2026-09-02
- 实测者称 Fable 5.1 视觉+逻辑登顶,私测逻辑基准 78 分破纪录 — Afinetheorem · 2026-09-02
- Muse Spark 1.2 写作能力评测:自然度超越当前主流模型 — intellectronica · 2026-09-02
- Qwen 团队发电商 Agent 基准:18 个前沿模型跑全年模拟无一家全面领先 — dair_ai · 2026-09-02
- 技巧展示:通过放置图像诱使 Atlas 生成 3D 场景 — toptickcrypto · 2026-09-02