GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍

开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差,但开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍至38%,token使用效率同时提高约6倍。OpenAI官方发文确认并发布技术文章,工程师@ilanbigio指出模型评测通常不应在隔离环境下进行。该发现挑战了当前业界通用的隔离式模型评测方法,表明产品框架与模型能力的深度协同对复杂任务表现有决定性影响。

已确认

尚未确认

为什么重要

2026-07-30 ~ 2026-07-30 · 12 条相关

事件全程(共 2 集)→

一手来源

另有 3 条近重复转述:sandersted · ilanbigio · OpenAI