GPT-6 Astra 刷爆 ARC-AGI-3,操作步数少于人类平均
据 ARC Prize 官方博客,GPT-6 Astra 在专为对抗 LLM 缩放范式而设计的 ARC-AGI-3 上达到饱和,且完成任务所用操作步数比人类平均水平还少。对比之下,2024 年 o1 在早期版本上仅得 18%,2026 年更难的 ARC-AGI-3 发布时前沿 AI 表现也很有限。Gary Marcus 转引该分析称,此结果为其长期主张的「符号世界模型至关重要」假说提供了有力证据,Matt Turck 等人也热议这一评测结果。
2026-09-04 ~ 2026-09-04 · 4 条相关
- GPT-6 Astra 刷爆 ARC-AGI-3,操作步数还少于人类平均水平 — TimeTruth2490 · 2026-09-04
- Gary Marcus:GPT-6 Astra 在 ARC-AGI-3 印证符号世界模型假说 — GaryMarcus · 2026-09-04
- 为对抗缩放范式而生的 ARC-AGI-3 被 Astra 彻底打穿 — mattturck · 2026-09-04
- 专为对抗 LLM 扩展设计的 ARC-AGI-3,据称已被前沿模型 Astra 饱和 — mattturck · 2026-09-04