仅改两个 API 设置,OpenAI 模型 ARC-AGI-3 分数飙升且算力大降

xiaohu · x · 2026-07-30

OpenAI 近期复盘了其模型在 ARC-AGI-3 评测中「考砸」的原因,发现核心问题出在跑模型的程序上:模型每步推理的私有思考被清空,且上下文溢出时直接删除历史记录,导致模型失去记忆。

他们仅调整了两个 API 设置便修复了该问题:

这带来了显著效果:GPT-5.6 Sol 在公开题库的得分从 13.3% 飙升至 38.3%;同时大幅降低了推理成本,最高档位下每局输出 token 从 290 万骤降至 49 万(约六分之一)。

所属事件:优化测试框架让GPT-5.6在ARC-AGI-3跑分翻三倍(21 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →