OpenAI 调整 API 设置,GPT-5.6 在 ARC-AGI-3 分数翻三倍

GregKamradt · x · 2026-07-30

OpenAI 内部测试发现,通过启用特定的 API 设置(由服务端管理对话状态),GPT-5.6 Sol 在处理 ARC-AGI-3 等长程任务时的表现得到显著提升,不仅分数翻了三倍,还减少了 6 倍的输出 token。

ARC Prize 官方对此回应称,这种“带框架”的测试方式确实能保持多轮对话的连续性并提升成绩。但为了保证各大厂商之间公平比较,ARC 官方榜单依然采用“无框架”标准:所有模型都在相同的观测条件、系统提示和动作限制下运行,且对话状态完全由客户端管理,以防止针对特定开发者的设置优化或意外作弊。目前 ARC 正与 OpenAI 等实验室探讨如何合理引入这些服务端设置。

所属事件:优化测试框架让GPT-5.6在ARC-AGI-3跑分翻三倍(19 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →