科学基准新榜:GPT-6 Astra 与 Opus 5.5 领先 20 分

ArtificialAnlys · x · 2026-09-25

Artificial Analysis 在 Terminal-Bench-Science 上的测试显示,OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Opus 5.5 比第三名 Fable 5.1 高出约 20 分;两大实验室之外表现最好的是 Qwen3.8 Max (0902),仅 12%。同家族内,最新 GPT 与 Claude 模型在 max 档下相比前代(GPT-5.6 Sol、Opus 5)性能提升的同时还降低了单任务成本。

所属事件:Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →