Fable 5.1 科学能力翻倍,Terminal-Bench 超越 Opus
felixrieseberg · x · 2026-09-02
在斯坦福主导的 Terminal-Bench-Science 科学任务评测中,Fable 5.1 取得了 52.6% 的分数,比上一代 Fable 5 (24.7%) 翻了一倍多,也超过了 Opus 5 (29.0%)。这表明 AI 在科学推理领域取得了显著进展。
所属事件:Fable 5.1 科学评测翻倍并改进写作风格(3 条相关)→
「模型」频道最新
- Fable 5.1 体验:更倾向扮演管理者与全局规划 — AlchainHust · 2026-09-02
- 马斯克透露 Grok 4.7 将于 10 天后发布 — XFreeze · 2026-09-02
- 曝 OpenAI Astra 疑似采用破坏思维链可监控性技术 — sjgadler · 2026-09-02
- 实测 Fable 5.1:接手多天难题,比 Opus 更不「Claude 腔」 — DimitrisPapail · 2026-09-02
- 评论:不应过度悲观解读 Astra 的循环深度 — xuanalogue · 2026-09-02
- Astra 的“循环深度”架构:权衡与局限 — daniel_mac8 · 2026-09-02