GPT-6 Astra 实测 ARC v3:低推理档位准确率反超

Mike Knoop 公布了 ARC-AGI-3 上对 GPT-6 Astra 的测试结果:在较低 reasoning 档位、零或极少推理 token 的情况下,Astra 准确率约为 Sol max 的两倍。对公开游戏的行为统计显示其仅约 27% 的动作用到推理 token,暗示模型隐式推理能力可能大幅跃升,不再依赖显式的思维链。

2026-09-05 ~ 2026-09-05 · 2 条相关