GPT-6 Astra 刷爆 ARC-AGI-3,隐式推理引热议
ARC Prize 官方认证 OpenAI 的 GPT-6 Astra 在交互推理基准 ARC-AGI-3 上取得 SOTA 成绩,且其推理方式呈现出不同于以往模型的特征,引发社区对「隐式推理」的广泛讨论。François Chollet 称之为「阶跃式」能力飞跃。
已确认
- ARC Prize 官方(François Chollet 转述,m6、m4)公布:标准测试 harness 下得分 66%,使用连续对话/provider adapter harness 后达到 99%(99.9%),并在 96% 的 ARC-AGI 游戏上有表现。
- 同一模型在不同评测框架下成绩差异巨大:从标准框架的约 62.7%/63% 跳到 adapter harness 的 99% 以上,说明 harness 设计对成绩影响显著(m4、m3)。
- ARC Prize 官方博客披露,Astra 在该基准上实现饱和(拿到最高可达分数),完成任务所用的操作步数比人类玩家平均值更少(m1)。
- 有用户在 provider-adapter harness 下测得 Astra 无思维链(CoT)即拿到 97% 的成绩,发帖人 @haider1 称结果「相当离谱」(m3)。
- Mike Knoop(Metaculus 创始人,ARC Prize 相关)公布的实测图表显示:在较低 reasoning 档位下,Astra 每步动作经常输出零个推理 token,准确率反而反超 GPT-5.6 Sol 的两倍(m2)。
- @mhmazur 提供的行为统计:标准环境、低推理力度下,GPT-5.6 Sol 有 98% 的动作使用推理 token,而 GPT-6 Astra 仅 27%,暗示隐式推理大幅跃升(m5)。
为什么重要
- Astra 在几乎不生成显式推理 token 的情况下仍取得高分,挑战了「更多推理 token=更强表现」的假设,可能标志着模型内部化推理能力的新范式。
- 标准与专用 harness 之间 30+ 个百分点的差距,再次凸显评测方法对模型能力评估的关键影响。
- 用步数少于人类平均即完成任务,说明其交互式推理效率已可与人类玩家比较。
2026-09-04 ~ 2026-09-05 · 6 条相关
- 第 1 集:GPT-6 Astra 刷爆 ARC-AGI-3,隐式推理引热议(2026-09-04,6 条)
- 第 2 集:GPT-6 Astra 被指 token 效率惊人 性价比成隐藏杀招(2026-09-05,3 条)
- 第 3 集:开发者实测 Astra 计算机操作 称已达超人级(2026-09-05,2 条)
一手来源
- GPT-6 Astra 横扫 ARC-AGI-3:标准 66%,专用 harness 近满分 — AccBalanced ·
- Astra 刷满 ARC-AGI-3 基准,用步数比人类平均更少 — ObiWanCanownme ·
- GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升 — mhmazur ·
- 【源头】Astra 刷满 ARC-AGI-3 基准,用步数比人类平均更少 — ObiWanCanownme · 2026-09-04
- GPT-6 Astra 无 CoT 在 ARC-AGI-3 得 97%,发帖人直呼离谱 — haider1 · 2026-09-04
- 【源头】GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升 — mhmazur · 2026-09-05
- ARC v3 实测:Astra 低档零推理 token,准确率反超 Sol max 两倍 — rbhar90 · 2026-09-05
- GPT-6 Astra 刷爆 ARC-AGI-3:换评测框架从 62.7% 跳到 99.9% — rohanpaul_ai · 2026-09-05
- 【源头】GPT-6 Astra 横扫 ARC-AGI-3:标准 66%,专用 harness 近满分 — AccBalanced · 2026-09-05