Opus 5.5 拉满推理算力科学基准涨 38 分,成本贵 5 倍
ArtificialAnlys · x · 2026-09-25
Artificial Analysis 测评显示,Terminal-Bench-Science 能很好地区分不同模型及同一模型不同推理档位:Claude Opus 5.5 从 low 档的 24% 升到 xhigh 档的 62%,提升约 38 分,但每任务成本相差 5 倍;max 档反而略低于 xhigh(59%)。GPT-6 Sol 从 low 到 max 提升 27 分,成本约 7.5 倍。
所属事件:Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑(3 条相关)→
「模型」频道最新
- Meta Muse Spark 1.3 被曝利用 Lean 内核已知漏洞作弊通过评测 — dhadfieldmenell · 2026-09-25
- 博主盛赞 Opus 5.5:品味出众不再啰嗦,称风评已彻底逆转 — kimmonismus · 2026-09-25
- Opus 5.5 花 77M tokens 用纯代码做出视频加互动应用 — NathanWilbanks_ · 2026-09-25
- Meta Muse 实时语音团队亮相,眼镜端实测即将开放 — alex_conneau · 2026-09-25
- Meta 推出 Muse Code 终端多智能体编码工具,重置用量额度 — armand_ruiz · 2026-09-25
- GLM 5.3 Flash 九折优惠仅剩一周,批量任务成本低至0.9美分 — shensi · 2026-09-25