Claude Opus 5 视觉评测落后且成本高昂

在 EyeBench-V3 基准测试中,Claude Opus 5 虽然超越了同门的 Fable 5 成为 Anthropic 表现最好的模型,但整体性能依然落后于 GPT 和 Gemini。成本方面,尽管 Opus 5 的运行成本比 Fable 5 低约 14%,但其输出极为冗长,生成的 Token 数量约为后者 2.5 倍,导致单任务成本逼近 GPT 5.6 Sol 的两倍。

2026-07-25 ~ 2026-07-25 · 4 条相关

事件全程(共 10 集)→