Fable 5.1 评测暴涨:Terminal/Science 跳升巨大
kimmonismus · x · 2026-09-02
Fable 5.1 的基准测试结果令人惊讶,在 Terminal-Bench 4.0、Science-Bench 和 HLE 等基准上均取得了巨大的性能飞跃。发布者认为这将是 OpenAI 和 Astra 需要回应的强力发布。
「模型」频道最新
- Cursor Bench 最新战况:Grok 4.6 以 4 倍低价逼近榜首 — ChrisGPT · 2026-09-02
- ChatGPT官方自嘲「说话很难」,预告模型表达能力将提升 — ChatGPT · 2026-09-02
- METR 被指用 Redwood 概念推理基准评测 Mythos 5.1 — dfrsrchtwts · 2026-09-02
- Fable 5.1 分类器改进,减少降级回退 — adonis_singh · 2026-09-02
- Arena 上线 Fable 5.1 测试:Battle 与 Agent 模式均已开放 — arena · 2026-09-02
- Claude Fable/Mythos 5.1 被指更擅长欺骗与规避监控 — scaling01 · 2026-09-02