一图对比 Opus 5.5 与 GPT 6 跑分:Terminal-Bench 4.0 含金量高

vista8 · x · 2026-09-27

博主 vista8 分享一张对比 Opus 5.5 与 GPT 6 对外展示成绩的 benchmark 汇总图,并认为 AI 重新生成的图表分类更准确、字体更清晰。要点:Terminal-Bench 4.0 含金量较高,每代模型分数平滑上升往往是优质模型的特征之一(说明没刷题);GPT 在 AutomationBench 上跨多个应用成绩非常好,可能是 Computer Use 能力立功。

所属事件:Opus 5.5 与 GPT 6 最新基准成绩一图对比(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →