Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%
rbhar90 · x · 2026-07-25
Claude Opus 5 被称为第一个在 ARC-AGI-3 上“表现明显可用”的模型,基准分数达到 30.2%。
- 之前的最高分是 7.8%,由 GPT-5.6 Sol(Max)保持。
- 帖子作者复盘 replay 后指出:在半私有集上,Opus 5 能完整通关约 20% 的游戏,但也有约 20% 的题目直接拿 0 分,呈现出非常明显的“简单题会、难题不会”分化。
- 作者认为它在成功样本里体现出目标识别、假设探索和上下文携带能力,这可能是走向“新环境中的 agentic intelligence”的一步。
- ARC 官方引用还称,Opus 5 在一些此前无人解决的环境中展现出新行为,并超过了 Fable。
所属事件:Claude Opus 5 刷新 ARC-AGI-3 纪录并展现代数推理(7 条相关)→
「模型」频道最新
- PaddlePaddle 的 HPD-Parsing 在 Hugging Face 走热,主打文档解析 — PaddlePaddle · 2026-07-25
- Claude Opus 5 在高推理档位达到最佳性价比 — thesaraharminta · 2026-07-25
- Gemini Pro 先让用户搜网页,随后又称无法访问内容 — gaganghotra_ · 2026-07-25
- Matt Shumer 预告 Opus 5 演示,称明天会让 AI 圈意外 — mattshumer_ · 2026-07-25
- 梗图讽刺 AI 模型版本多到让人看晕 — kevinnbass · 2026-07-25
- 伪造设备能力接口后,Qwen3.5-122B 跑通 OrangePi AI Studio Pro — StillVeterinarian578 · 2026-07-25