Fable 5.1 科学能力翻倍,Terminal-Bench 超越 Opus

felixrieseberg · x · 2026-09-02

在斯坦福主导的 Terminal-Bench-Science 科学任务评测中,Fable 5.1 取得了 52.6% 的分数,比上一代 Fable 5 (24.7%) 翻了一倍多,也超过了 Opus 5 (29.0%)。这表明 AI 在科学推理领域取得了显著进展。

所属事件:Fable 5.1 科学评测翻倍并改进写作风格(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →