OpenAI:优化 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分翻三倍

OpenAI · x · 2026-07-30

OpenAI 官方发文披露了 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试中的最新表现。研究发现,该模型此前在 2D 益智游戏测试中表现不佳,原因是测试框架(harness)未能让模型有效保留学习记忆。

通过启用保留推理(retained reasoning)和上下文压缩(context compaction)两项 API 设置,模型在输出 token 量减少 6 倍的情况下,得分从 13.3% 跃升至 38.3%。这证明了更优的测试框架与上下文管理能大幅激发模型的推理潜力。

所属事件:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →