GPT-6 Astra 登顶 Terminal-Bench-Science,超越 Fable 5.1

burny_tech · x · 2026-09-04

据 askalphaxiv 评测,GPT-6 Astra 在 Terminal-Bench-Science 0.1 上登顶,超过刚发布的 Fable 5.1。此前 Fable 5.1 以 52.6% 的成绩大幅领先 Fable 5(24.7%)和 GPT-5.6 Sol(22.4%),成为自动科研(autoresearch)最强的模型,如今位置已被刷新。

作者指出一个趋势:OpenAI 和 Anthropic 在模型发布博客中都首选报告 Terminal-Bench Science,说明各家实验室正把「智能体化科学研究能力」当作衡量模型质量的新试金石,每次发版都在把这个方向往前推。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →