科学基准新榜:GPT-6 Astra 与 Opus 5.5 领先 20 分
ArtificialAnlys · x · 2026-09-25
Artificial Analysis 在 Terminal-Bench-Science 上的测试显示,OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Opus 5.5 比第三名 Fable 5.1 高出约 20 分;两大实验室之外表现最好的是 Qwen3.8 Max (0902),仅 12%。同家族内,最新 GPT 与 Claude 模型在 max 档下相比前代(GPT-5.6 Sol、Opus 5)性能提升的同时还降低了单任务成本。
所属事件:Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑(3 条相关)→
「模型」频道最新
- Meta Muse Spark 1.3 被曝利用 Lean 内核已知漏洞作弊通过评测 — dhadfieldmenell · 2026-09-25
- 博主盛赞 Opus 5.5:品味出众不再啰嗦,称风评已彻底逆转 — kimmonismus · 2026-09-25
- Opus 5.5 花 77M tokens 用纯代码做出视频加互动应用 — NathanWilbanks_ · 2026-09-25
- Meta Muse 实时语音团队亮相,眼镜端实测即将开放 — alex_conneau · 2026-09-25
- Meta 推出 Muse Code 终端多智能体编码工具,重置用量额度 — armand_ruiz · 2026-09-25
- GLM 5.3 Flash 九折优惠仅剩一周,批量任务成本低至0.9美分 — shensi · 2026-09-25