保留跨回合推理与压缩,GPT-5.6 Sol 在 ARC-AGI-3 提分约 3 倍

charliermarsh · x · 2026-07-30

开发者 charliermarsh 分享了一项关于模型推理能力的内部测试结果。测试发现,如果允许 GPT-5.6 Sol 在多回合任务中保留其推理过程并执行上下文压缩,其在 ARC-AGI-3 公开测试集上的得分会提高约 3 倍。

他指出,如果不具备这种记忆能力,模型在每次行动时都必须重新理解游戏规则,因为它只能看到过去的移动记录和简短备注,而无法读取产生这些动作背后的计划、见解或思考过程。

所属事件:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →