Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑

Artificial Analysis 上线 Terminal-Bench-Science 0.1 排行榜,由斯坦福研究者与 Terminal-Bench 团队及开源社区共建。榜单显示 GPT-6 Astra 与 Claude Opus 5.5 领跑,领先其他模型约 20 分。该基准能有效区分不同模型及同一模型的不同推理档位:Claude Opus 5.5 拉满推理算力后科学基准成绩提升 38 分,但成本贵 5 倍。

2026-09-25 ~ 2026-09-25 · 3 条相关