GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍
开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差,但开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍至38%,token使用效率同时提高约6倍。OpenAI官方发文确认并发布技术文章,工程师@ilanbigio指出模型评测通常不应在隔离环境下进行。该发现挑战了当前业界通用的隔离式模型评测方法,表明产品框架与模型能力的深度协同对复杂任务表现有决定性影响。
已确认
- 开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差。
- 开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍,达到38%。
- Token使用效率同时提高约6倍。
- 这两项设置分别为上下文压缩(compaction)与推理记忆保留(reasoning retention),允许模型记住先前的思考并跨多个上下文窗口进行推理。
- OpenAI发布技术文章详细介绍了该优化策略,工程师@ilanbigio发文指出,模型评测通常不应在隔离环境下进行。
尚未确认
- 无。
为什么重要
- 该发现挑战了当前业界通用的隔离式模型评测方法,开发者@Angaisb指出,通过优化测试框架就能轻易解决复杂任务,这意味着此类基准测试并不能真实代表模型的实际能力。
- 产品框架(如ChatGPT和Codex的内部机制)与模型能力的深度协同,对模型在复杂任务上的表现有决定性影响。
- 单纯比较模型在裸跑基准测试中的分数,可能无法准确衡量不同AI系统的真实智能水平。
2026-07-30 ~ 2026-07-30 · 12 条相关
- 第 1 集:OpenAI 称 GPT-5.6 Sol 实现自我优化,推理成本降 20%(2026-07-30,8 条)
- 第 2 集:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(2026-07-30,12 条)
一手来源
- OpenAI:优化 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分翻三倍 — OpenAI ·
- 实测:开启两项 API 设置,GPT-5.6 在 ARC-AGI-3 跑分飙升 3 倍 — sandersted ·
- OpenAI 揭示上下文压缩机制,GPT-5.6 ARC-AGI-3 成绩飙升至 38% — ilanbigio ·
- GPT-5.6 跑分翻车?开启特定 API 设置后效率暴增 — sandersted · 2026-07-30
- 曝GPT-5.6开启特定API设置后,ARC-AGI-3得分飙升3倍 — sandersted · 2026-07-30
- GPT-5.6开启记忆后,ARC-AGI-3分数飙升3倍 — sandersted · 2026-07-30
- 【源头】OpenAI 揭示上下文压缩机制,GPT-5.6 ARC-AGI-3 成绩飙升至 38% — ilanbigio · 2026-07-30
- 优化测试框架即破纪录,ARC-AGI-3 被指不能反映真实能力 — Angaisb_ · 2026-07-30
- 仅改两个设置,OpenAI 在 ARC-AGI-3 跑分翻三倍 — ObiWanCanownme · 2026-07-30
- 【源头】OpenAI:优化 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分翻三倍 — OpenAI · 2026-07-30
- 上下文压缩立功,GPT-5.6 登顶 ARC-AGI-3 — daniel_mac8 · 2026-07-30
- 保留跨回合推理与压缩,GPT-5.6 Sol 在 ARC-AGI-3 提分约 3 倍 — charliermarsh · 2026-07-30
另有 3 条近重复转述:sandersted · ilanbigio · OpenAI