GPT-6 Astra 登顶 Terminal-Bench Science,领先第二名 31.4 分

DeryaTR_ · x · 2026-09-21

Vals AI 上线了 Terminal-Bench Science 基准:由领域研究者编写并审校的 70 个科研工作流任务,涵盖信号重建、模型校准等,考察模型能否真正做科学研究。

榜单结果宣称 GPT-6 Astra 以 65.7% 大幅领先,比第二名 Claude Fable 5.1(34.3%)高出 31.4 个百分点;其余模型无一超过 25%,24 个模型中有 12 个得分在 4.3% 及以下。(注:模型名为推文转述,未经官方证实)

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →