Fable 5.1 科研 Benchmark 解析:成功率翻倍至 53.6%

johnseach · x · 2026-09-02

针对 Fable 5.1 宣传中的“Agentic Scientific Research”概念进行解析。其本质是 AI 能够接手真实的科学计算任务,通过终端工具完成工作。在 Terminal-Bench-Science 0.1 评测集(70 个专家任务)上,Fable 5.1 的成功率从约 25% 跃升至 53.6%。这标志着自主执行科研工作流能力的重大进步,尽管离完全解决科学问题尚远。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →