Opus 5.5 与 GPT-6 Sol 同日发布,全基准对比:跑分全胜,Sol 靠省钱
Vast-Grapefruits · reddit · 2026-09-23
Anthropic 与 OpenAI 同日发布 Opus 5.5 和 GPT-6 Sol,作者整理了能找到的全部基准做正面对比:
- 裸分:Opus 5.5 在表中所有基准上全部领先。
- 意外点:在衡量「真实办公室工作」的 GDPval 上,Sol 比 它替代的 GPT-5.6 Sol 低约 100 Elo。Artificial Analysis 分析称下滑主要来自交付物质量差——漏掉任务的必要部分——而非推理失败。
- Sol 的王牌是成本:每 token 价格约为 Opus 的一半,且 Opus 极其费 token:在最高 effort 下 AA 测得 Opus 5.5 每任务约 119K 输出 token,Sol 约 31K,跑完整个索引 Sol 每任务仅约 $1.06。
结论:Opus 赢在能力,Sol 赢在性价比;真实世界表现还要看接下来几天的用户反馈。
所属事件:Claude Opus 5.5 发布即登顶智能指数,降价提速引发热议(50 条相关)→
「模型」频道最新
- 第三方实测:Claude Opus 5.5 出图更精细,成本却是 GPT-6 Sol 的 13 倍 — testingcatalog · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最佳视觉设计能力 — burny_tech · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23
- Claude 5.5 被曝持续生成用户回合,模型行为再现异常 — BlackHC · 2026-09-23
- 代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark — almmaasoglu · 2026-09-23
- 信封上画草图,Grok 4.7 几分钟内做出可玩解谜游戏 Lightweave — luismbat · 2026-09-23