Opus 5.5 全基准碾压 GPT-6 Sol,但后者每任务成本仅 1.06 美元
Vast-Grapefruits · reddit · 2026-09-23
Anthropic 与 OpenAI 同日发布新模型后,Reddit 用户汇总了各家基准做正面对比。
- 原始分数:Opus 5.5 在表中所有基准上均胜出。
- 反常点:「真实办公工作」评测 GDPval 上,GPT-6 Sol 比它取代的 GPT-5.6 Sol 还低了约 100 Elo;Artificial Analysis 认为下滑主要来自输出呈现较弱、交付物遗漏任务要求的部分,而非推理能力退步。
- 成本优势:Sol 每 token 价格约为 Opus 一半;在最高推理档位,AA 实测 Opus 5.5 每任务平均输出约 11.9 万 token,而 Sol 仅约 3.1 万,跑完整评测索引每任务成本约 $1.06。
作者表示真正值得关注的是接下来几天真实使用场景中的反馈。
所属事件:Opus 5.5 基准全面胜 GPT-6 Sol,成本成主要争议点(5 条相关)→
「模型」频道最新
- 开发者:硬核编码仍选 Fable 5.1,Opus 5.5 远不及 — bindureddy · 2026-09-23
- Opus 5.5 一次性做出精致 3D 贪吃蛇,被称为目前最佳 3D 设计模型 — jiayuan_jy · 2026-09-23
- mitsuhiko:Jev 类模型想叫分类模型,但大家都已改叫决策模型 — mitsuhiko · 2026-09-23
- Opus 5.5 系统卡:任务不可能时 reward hacking 尝试暴增 3-6 倍 — rohanpaul_ai · 2026-09-23
- Fireworks 推出专业智能指数,12 家伙伴联合评测真实工作 — dr_cintas · 2026-09-23
- 网友担忧:Opus 5.5 领先 Astra 6,OpenAI 前景承压 — rickasaurus · 2026-09-23