Claude Opus 5 视觉评测落后且成本高昂
在 EyeBench-V3 基准测试中,Claude Opus 5 虽然超越了同门的 Fable 5 成为 Anthropic 表现最好的模型,但整体性能依然落后于 GPT 和 Gemini。成本方面,尽管 Opus 5 的运行成本比 Fable 5 低约 14%,但其输出极为冗长,生成的 Token 数量约为后者 2.5 倍,导致单任务成本逼近 GPT 5.6 Sol 的两倍。
2026-07-25 ~ 2026-07-25 · 4 条相关
- 第 1 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 2 集:Anthropic 发布 Claude Opus 5,编码能力达 SOTA(2026-07-25,80 条)
- 第 3 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 4 集:Claude Opus 5 早期反馈:编码强但破坏旧工作流(2026-07-25,5 条)
- 第 5 集:Anthropic 称 Claude Opus 5 刻意限制网络安全训练(2026-07-25,5 条)
- 第 6 集:Claude Opus 5 多榜单登顶成新 SOTA(2026-07-25,5 条)
- 第 7 集:Claude Opus 5 刷新 ARC-AGI-3 纪录并展现代数推理(2026-07-25,6 条)
- 第 8 集:Opus 5在FrontierCode测试中中等推理性能最佳(2026-07-25,7 条)
- 第 9 集:Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)
- 第 10 集:Claude Opus 5 提供五档推理强度并默认开启(2026-07-25,2 条)
- Claude Opus 5 在 EyeBench-V3 上压过 Fable 5 但仍落后 GPT 和 Gemini — adonis_singh · 2026-07-25
- Opus 5 在 EyeBench-V3 上比 Fable 5 便宜 14%,却多输出 2.5 倍 token — adonis_singh · 2026-07-25
- 实测 Opus 与 Fable 成本:输出冗长致费用逼近 — adonis_singh · 2026-07-25
- 图表显示 Claude Opus 5 单任务成本约为 GPT 5.6 Sol 的两倍 — soumitrashukla9 · 2026-07-25