Claude Opus 5 在 ARC-AGI-3 上达到 30.2%,远超此前前沿成绩
EricBuess · x · 2026-07-25
这条转发强调了 ARC-AGI-3 的难度和最新成绩:
- 这个基准被设计得非常“残酷”,人类可以解出 100% 的环境,而截至 3 月时,所有前沿模型都还不到 1%。
- 配图显示 Claude Opus 5(high) 已经做到 30.2%,相比此前前沿结果 7.8% 有明显跃升。
- 图里还展示了“总评测成本 vs 得分”的关系,说明这次进展不仅是分数提升,也伴随显著的评测成本上升。
所属事件:Claude Opus 5 刷新 ARC-AGI-3 纪录并展现代数推理(6 条相关)→
「模型」频道最新
- Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑 — CtrlAltDwayne · 2026-07-25
- SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5 — HamelHusain · 2026-07-25
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25
- Claude Opus 5 被指在 3D 编码测试上胜过 Fable 5 — rohanpaul_ai · 2026-07-25
- 前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop · 2026-07-25
- 图表称 Claude Opus 5 对防御编码拦截更少 — repligate · 2026-07-25