Claude Opus 5 在 ARC-AGI-3 上达到 30.2%,远超此前前沿成绩
EricBuess · x · 2026-07-25
这条转发强调了 ARC-AGI-3 的难度和最新成绩:
- 这个基准被设计得非常“残酷”,人类可以解出 100% 的环境,而截至 3 月时,所有前沿模型都还不到 1%。
- 配图显示 Claude Opus 5(high) 已经做到 30.2%,相比此前前沿结果 7.8% 有明显跃升。
- 图里还展示了“总评测成本 vs 得分”的关系,说明这次进展不仅是分数提升,也伴随显著的评测成本上升。
所属事件:Claude Opus 5 创下 ARC-AGI-3 新纪录(15 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11