GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升

mhmazur · x · 2026-09-05

GPT-6 Astra 在 ARC-AGI-3 上的新数据点

在标准测试环境、低推理力度下,对 ARC-AGI-3 公开游戏的行为统计显示:

半私有游戏上呈现相同模式,说明差异并非公开基准污染所致,而可能反映 GPT 模型架构层面的变化。

Ryan Greenblatt 讨论中指出,GPT-6 Astra 的隐式推理能力似乎是巨大飞跃:看起来能在「脑内」直接解出高难度竞赛数学题(无需外显的思维链),而此前的 AI 只能解基础应用题。作者认为如果基准结果有代表性,这一点相当值得警惕,但也强调需注意图中标注的多项注意事项。

整体仍属第三方观察分析,结论有待更多验证。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →