Anthropic 新版 Fable/Mythos 5.1 基准测试成绩曝光
minxio_ · reddit · 2026-09-02
Reddit 用户分享了 Claude Fable 5.1 和 Claude Mythos 5.1 的基准测试成绩图表(图片)。从图片可见,新模型在多项指标上相较前代有显著提升(具体数据见图片)。这些数据展示了模型在编程和知识工作领域的性能进步。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- 只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判 — trq212 · 2026-09-12
- LightSpeed 播客:GPT-6 Astra 推理链可绕过部分监控,审计力成新卖点 — buckymoore · 2026-09-12
- OpenAI 图像生成输出格式不可控,预览图常比成图更好 — No_Body_4834 · 2026-09-12
- 用户报告 Gemini Pro 3.1 突然拒绝回答简单请求 — kostaslamprou · 2026-09-12
- 初创公司用 GPT-6 Astra 打造无人机,一张照片即可锁定追踪特定人 — Polymarket · 2026-09-12
- 397B 多模态新模型 Nex-N2.5 Pro 上架 OpenRouter,主打 Computer Use — nikola_mr64990 · 2026-09-12