GPT-6 Astra 刷爆 ARC-AGI-3,操作步数少于人类平均

据 ARC Prize 官方博客,GPT-6 Astra 在专为对抗 LLM 缩放范式而设计的 ARC-AGI-3 上达到饱和,且完成任务所用操作步数比人类平均水平还少。对比之下,2024 年 o1 在早期版本上仅得 18%,2026 年更难的 ARC-AGI-3 发布时前沿 AI 表现也很有限。Gary Marcus 转引该分析称,此结果为其长期主张的「符号世界模型至关重要」假说提供了有力证据,Matt Turck 等人也热议这一评测结果。

2026-09-04 ~ 2026-09-04 · 4 条相关