Claude Opus 5 在 ARC-AGI-3 评测中得分超次优模型三倍
claudeai · x · 2026-07-25
Anthropic 公布了 Claude Opus 5 在 ARC-AGI-3 基准测试中的表现。该测试主要用于评估 AI 模型解决新颖问题的能力,而 Opus 5 的得分是排名第二的模型的三倍,展现出极强的推理与泛化能力。
所属事件:Anthropic 发布 Claude Opus 5,性能达新 SOTA 且价格减半(25 条相关)→
「模型」频道最新
- Claude Opus 5 像更便宜的 Fable — cedric_chee · 2026-07-25
- Anthropic 发布 Claude Opus 5,盲测排名超过 GPT-5.6 — lennysan · 2026-07-25
- Claude Opus 5 在 Frontier-Bench 得分 43.3%,定价仍是 $5/$25 — mark_k · 2026-07-25
- Claude Opus 5 的 ARC-AGI-3 图表引发一句惊叹 — var_epsilon · 2026-07-25
- Notion 收购 ZeroEntropy,reranker 也开源成 Apache 2.0 — CShorten30 · 2026-07-25
- Anthropic 称 Opus 5 以半价逼近 Fable 5 基准表现 — dotey · 2026-07-25