OpenAI 优化 ARC-AGI-3 测试框架,分数提升 188%

OpenAI · x · 2026-07-30

OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 测试中表现不佳的原因是标准测试框架会在每步操作后丢弃模型的推理过程,并在上下文填满时丢失早期操作记录。

通过改用 Responses API 并开启保留推理与上下文压缩功能,模型能够积累学习经验。这使得 GPT-5.6 Sol 在公开测试集上的得分飙升了 188%,同时输出 token 的消耗量减少了 6 倍。

所属事件:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(12 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →