Claude Opus 5 在 ARC-AGI-3 上被指领先第二名 3 倍
zainhas · x · 2026-07-25
Claude Opus 5 在 ARC-AGI-3 基准上的表现被指达到“次优前沿模型的 3 倍”,配图榜单也显示它明显领先。
- 图中的 Claude Opus 5 (High) 大约在 30% 左右,和其余模型拉开明显差距。
- 其他前沿模型大多仍停留在 个位数到接近 10% 的区间。
- 这条帖子的重点是:Anthropic 这次在偏“通用推理/抽象求解”类评测上出现了意外强势的结果。
所属事件:Claude Opus 5 创 ARC-AGI-3 纪录,展现代数推理新能力(11 条相关)→
「模型」频道最新
- Google 发布 1 小时智能体工程课程,讲记忆与 MCP — ifioknkem · 2026-07-25
- Opus 5 被称在三项表格智能体基准上跃升 — surmenok · 2026-07-25
- 一组图在对比当前各家 AI 的能力现状 — Fantastic_Recipe_ · 2026-07-25
- Claude Opus 5 上线,编程实测强但基准分数仍有争议 — Latent Space · 2026-07-25
- xAI 将 SuperGrok Heavy 降至每月 99 美元,三个月打 67 折 — ns123abc · 2026-07-25
- LLaDA2.2 把扩散大模型推向智能体任务,支持 128K 上下文自我编辑 — alifcoder · 2026-07-25