Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%
rbhar90 · x · 2026-07-25
Claude Opus 5 被称为第一个在 ARC-AGI-3 上“表现明显可用”的模型,基准分数达到 30.2%。
- 之前的最高分是 7.8%,由 GPT-5.6 Sol(Max)保持。
- 帖子作者复盘 replay 后指出:在半私有集上,Opus 5 能完整通关约 20% 的游戏,但也有约 20% 的题目直接拿 0 分,呈现出非常明显的“简单题会、难题不会”分化。
- 作者认为它在成功样本里体现出目标识别、假设探索和上下文携带能力,这可能是走向“新环境中的 agentic intelligence”的一步。
- ARC 官方引用还称,Opus 5 在一些此前无人解决的环境中展现出新行为,并超过了 Fable。
所属事件:Claude Opus 5 创下 ARC-AGI-3 新纪录(15 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11