Terminal-Bench-Science 榜单上线:GPT-6 Astra 与 Claude Opus 5.5 领跑
scaling01 · x · 2026-09-25
Artificial Analysis 上线 Terminal-Bench- science 0.1 的排行榜,这是斯坦福研究者与 Terminal-Bench 团队及开源社区共建的科研工作流 agent 基准:
- 目前领先者:GPT-6 Astra (max) 63%、Claude Opus 5.5 (xhigh) 62%,仅两款模型得分显著
- 基准含 70 个专家精选任务,源自五个领域真实科研:生命科学 19、物理 17、数学 17、工程 9、地球科学 8
- 与 Terminal-Bench 相同,每个任务将 agent 放入带数据、工具和指令的沙箱环境完整运行,自动化测试按 pass/fail 评分,报告 3 次尝试的平均 pass@1
所属事件:Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑(3 条相关)→
「模型」频道最新
- 数学基准新榜:Astra 一骑绝尘,Fable 5.1 以下无人能打 — teortaxesTex · 2026-09-25
- 网友晒出全部 Claude 模型的测试结果对比 — repligate · 2026-09-25
- 鹈鹕骑车捕鱼 3D 游戏开源:一句提示词零手工改动可自行验证 — EricBuess · 2026-09-25
- 为 4 岁女儿一句提示词,Opus 5.5 生成 3D 绘本农场游戏 — EricBuess · 2026-09-25
- 黑猫夜行跳跃游戏 CatWalk:Opus 5.5 一次成型,唯一改动是调低音效 — EricBuess · 2026-09-25
- 日本开发者一条提示词做鱼叉捕鱼游戏,仅花 3000 円套餐 16% 额度 — EricBuess · 2026-09-25