ARC Prize 测试:Claude Opus 5 在 ARC-AGI-3 公众演示得分 30.2%
inductionheads · x · 2026-07-25
Anthropic 的 Fable-class 模型在 ARC Prize 的测试里,ARC-AGI-3 Public Demo 环境得分约 20%。
- Claude Opus 5 达到 30.2%,明显领先 Fable-class 模型。
- ARC Prize 认为,这种提升主要来自更强的逻辑推理能力。
- 这种能力进一步提升了模型在陌生环境中的自主探索、规划与执行表现。
「模型」频道最新
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25
- Claude Code 触发拒绝后可静默回退到 Opus 4.8 — steipete · 2026-07-25
- 月之暗面 Kimi K3 宣布下周一发布,Baseten 送 API 额度 — baseten · 2026-07-25
- Claude Opus 5 据报在 2026 IMO 拿下 42/42 满分 — exordin26 · 2026-07-25
- Claude Opus 5 上线,Box 说企业 agent 任务大幅提升 — inductionheads · 2026-07-25
- 有人直言 Gemini 3.5 Pro 已经太晚难竞争 — teortaxesTex · 2026-07-25