一张图看懂 Opus 5.5 与 GPT 6 最新基准成绩对比
vista8 · x · 2026-09-27
作者整理了 Claude Opus 5.5 与 GPT 6 近期对外展示的 Benchmark 成绩对比图。
- Terminal-Bench 4.0:作者认为含金量较高,若每代模型分数平滑上升,往往是优质模型特征之一(说明没有针对性刷题)。
- AutomationBench:GPT 在该基准上成绩非常好,能跨多个应用完成任务,作者猜测可能是 Computer Use 能力立功。
整体是一份基于官方展示成绩的横向速览,帮助读者快速把握两家的能力侧重点。
所属事件:Opus 5.5 与 GPT 6 最新基准成绩一图对比(2 条相关)→
「模型」频道最新
- OpenAI 粉丝看衰 DevDay:没有单品能抗衡 Opus 5.5 — cedric_chee · 2026-09-28
- Claude Opus 5.5 与 GPT-6 相隔 101 分钟发布,双双降价开打价格战 — thursdai_pod · 2026-09-28
- DeepSeek 将在 48 小时内更新 0.2.0 版并正式发布桌面客户端 — teortaxesTex · 2026-09-28
- Cohere 发布 Parse 5:专攻企业文档解析,支持表格图表与边界框 — cohere · 2026-09-27
- 爆料称下周 OpenAI DevDay 与 Fable 5.5 齐发,加速未见放缓 — iruletheworldmo · 2026-09-27
- 开发者转向 Opus 5.5 与 Fable,编码模型使用格局悄然变化 — rudrank · 2026-09-27