GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升
mhmazur · x · 2026-09-05
GPT-6 Astra 在 ARC-AGI-3 上的新数据点
在标准测试环境、低推理力度下,对 ARC-AGI-3 公开游戏的行为统计显示:
- GPT-5.6 Sol:98% 的动作使用了推理 token
- GPT-6 Astra:仅 27% 的动作使用推理 token,降幅巨大
半私有游戏上呈现相同模式,说明差异并非公开基准污染所致,而可能反映 GPT 模型架构层面的变化。
Ryan Greenblatt 讨论中指出,GPT-6 Astra 的隐式推理能力似乎是巨大飞跃:看起来能在「脑内」直接解出高难度竞赛数学题(无需外显的思维链),而此前的 AI 只能解基础应用题。作者认为如果基准结果有代表性,这一点相当值得警惕,但也强调需注意图中标注的多项注意事项。
整体仍属第三方观察分析,结论有待更多验证。
「模型」频道最新
- 开发者讽刺 ARC-AGI 系列:游戏分辨率堆号数何时才算 AGI — AndrewDai · 2026-09-05
- Claude 完成费马大定理首个形式化证明:1300 万行 Lean 代码 — AnthropicAI · 2026-09-05
- 一周AI大发布:Fable 5.1、GLM-5.3权重、三个实时世界模型 — thursdai_pod · 2026-09-05
- Greg Brockman 以「欢迎来到 AGI 时代」为 GPT-6 发布会收尾 — thursdai_pod · 2026-09-05
- GPT-6 计算机使用直播实测:macOS 模拟器演示「真的能用」 — thursdai_pod · 2026-09-05
- 9 月 3 日成「AGI 日」:前沿实验室齐发 .1,GPT-6 抢尽风头 — thursdai_pod · 2026-09-05