Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑
Artificial Analysis 上线 Terminal-Bench-Science 0.1 排行榜,由斯坦福研究者与 Terminal-Bench 团队及开源社区共建。榜单显示 GPT-6 Astra 与 Claude Opus 5.5 领跑,领先其他模型约 20 分。该基准能有效区分不同模型及同一模型的不同推理档位:Claude Opus 5.5 拉满推理算力后科学基准成绩提升 38 分,但成本贵 5 倍。
2026-09-25 ~ 2026-09-25 · 3 条相关
- Opus 5.5 拉满推理算力科学基准涨 38 分,成本贵 5 倍 — ArtificialAnlys · 2026-09-25
- 科学基准新榜:GPT-6 Astra 与 Opus 5.5 领先 20 分 — ArtificialAnlys · 2026-09-25
- Terminal-Bench-Science 榜单上线:GPT-6 Astra 与 Claude Opus 5.5 领跑 — scaling01 · 2026-09-25