实测:开启两项 API 设置,GPT-5.6 在 ARC-AGI-3 跑分飙升 3 倍

sandersted · x · 2026-07-30

开发者 @sandersted 分享了一项关于模型测试的惊人发现。他指出,GPT-5.6 在 ARC-AGI-3 基准测试中初始表现极差。

然而,当开启 ChatGPT 和 Codex 内部使用的两项特定 API 设置后,其在公共数据集上的得分直接飙升了约 3 倍,且 token 消耗效率提升了约 6 倍。

这再次证明了一个行业共识:模型的实际性能永远是“模型本身 + 产品框架”的综合结果,脱离了工程包装单纯谈论裸模型能力是毫无意义的。

所属事件:GPT-5.6开启特定API设置后ARC-AGI-3得分飙升3倍(10 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →