一图对比 Opus 5.5 与 GPT 6 跑分:Terminal-Bench 4.0 含金量高
vista8 · x · 2026-09-27
博主 vista8 分享一张对比 Opus 5.5 与 GPT 6 对外展示成绩的 benchmark 汇总图,并认为 AI 重新生成的图表分类更准确、字体更清晰。要点:Terminal-Bench 4.0 含金量较高,每代模型分数平滑上升往往是优质模型的特征之一(说明没刷题);GPT 在 AutomationBench 上跨多个应用成绩非常好,可能是 Computer Use 能力立功。
所属事件:Opus 5.5 与 GPT 6 最新基准成绩一图对比(2 条相关)→
「模型」频道最新
- Perplexity CEO 实测:百个工作流从 Opus 5.5 换回 Fable 5.1 差异甚微 — AravSrinivas · 2026-09-28
- Claude 态度变差还冒出「For anyone reading along」引用户困惑 — MrsChatGPT4o · 2026-09-28
- Matt Shumer:Opus 5.5 一句话给他的产品加上了手柄支持 — mattshumer_ · 2026-09-28
- Grok Bot 已可在 Tesla 车机运行,澳洲车主实测发邮件记笔记 — yunta_tsai · 2026-09-28
- 研究员实测 Claude Opus 5.5 拒答人口伦理难题,疑因结论太反直觉 — anderssandberg · 2026-09-28
- 小米 MiMo-V2.6-Flash-MOPD 上架 Hugging Face — Automatic-Arm8153 · 2026-09-28