Opus 5.5 拉满推理算力科学基准涨 38 分,成本贵 5 倍

ArtificialAnlys · x · 2026-09-25

Artificial Analysis 测评显示,Terminal-Bench-Science 能很好地区分不同模型及同一模型不同推理档位:Claude Opus 5.5 从 low 档的 24% 升到 xhigh 档的 62%,提升约 38 分,但每任务成本相差 5 倍;max 档反而略低于 xhigh(59%)。GPT-6 Sol 从 low 到 max 提升 27 分,成本约 7.5 倍。

所属事件:Terminal-Bench-Science 榜单上线 GPT-6 Astra 与 Opus 5.5 领跑(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →