Fable 5.1 科研 Benchmark 解析:成功率翻倍至 53.6%
johnseach · x · 2026-09-02
针对 Fable 5.1 宣传中的“Agentic Scientific Research”概念进行解析。其本质是 AI 能够接手真实的科学计算任务,通过终端工具完成工作。在 Terminal-Bench-Science 0.1 评测集(70 个专家任务)上,Fable 5.1 的成功率从约 25% 跃升至 53.6%。这标志着自主执行科研工作流能力的重大进步,尽管离完全解决科学问题尚远。
「模型」频道最新
- 专家质疑 OpenAI Astra 评估存数据污染与元游戏风险 — ShakeelHashim · 2026-09-02
- Astra 刷爆 ExploitBench 百分百胜率,达网安临界能力 — infoxiao · 2026-09-02
- Anthropic 用激活探针检测 Claude 网络安全威胁 — nrehiew_ · 2026-09-02
- RWKV-7 G1j 发布:纯 RNN 架构在 agent 与编码任务大幅增强 — jeremyphoward · 2026-09-02
- Fable 5.1 三十分钟一次成型可用的吉他 VST 插件 — CtrlAltDwayne · 2026-09-02
- Fable 5.1 自选目标解开 373 年历史密码 — rickasaurus · 2026-09-02