专题 · FULL STORY

GPT-5.6:从自我优化到跑分飙升

OpenAI 宣布利用 GPT-5.6 实现推理栈自我优化,使成本大幅降低。随后开发者发现,开启特定 API 设置后,该模型在 ARC-AGI-3 测试中的得分飙升三倍,揭示了其隐藏潜力。

2026-07-30 ~ 2026-07-30 · 2 集 · 23 条

第 1 集 · OpenAI 称 GPT-5.6 Sol 实现自我优化,推理成本降 20%(2026-07-30,8 条)

OpenAI 宣布在部署 GPT-5.6 (Sol) 模型后,利用该模型实现了对自身推理栈的自我优化,达成了前沿智能与运行效率的融合。官方数据显示,此次优化使服务成本降低 20%,Token 生成效率提升 15% 以上。这标志着大模型已具备优化底层基础设施以降低高昂推理成本的能力,值得行业关注。

已确认

  • 模型与部署:OpenAI 已部署 GPT-5.6 Sol 模型,并在 Codex 环境中进行了运行与优化测试。
  • 服务成本降低:GPT-5.6 Sol 通过改进生产环境的 GPU 内核(重写底层代码),成功使端到端服务成本降低了 20%。
  • 生成效率提升:通过改进推测性解码(并协助优化用于加速生成的小型模型),Token 生成效率提升了 15% 以上。

为什么重要

  • AI 自我优化:此次优化并非单纯的人工调优,而是 GPT-5.6 Sol 模型直接参与了自身运行效率的提升。这表明先进的 AI 模型不仅能执行复杂任务,还能作为优化工具,直接解决大模型推理成本高昂的行业痛点,为提升商业化和运行效率提供了新路径。

第 2 集 · GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(2026-07-30,15 条)

开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差,但开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍至38%,token使用效率同时提高约6倍。OpenAI官方发文确认并发布技术文章,工程师@ilanbigio指出模型评测通常不应在隔离环境下进行。该发现挑战了当前业界通用的隔离式模型评测方法,表明产品框架与模型能力的深度协同对复杂任务表现有决定性影响。

已确认

  • 开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差。
  • 开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍,达到38%。
  • Token使用效率同时提高约6倍。
  • 这两项设置分别为上下文压缩(compaction)与推理记忆保留(reasoning retention),允许模型记住先前的思考并跨多个上下文窗口进行推理。
  • OpenAI发布技术文章详细介绍了该优化策略,工程师@ilanbigio发文指出,模型评测通常不应在隔离环境下进行。
  • 开发者@charliermarsh补充,如果不允许模型保留跨回合的推理记忆,模型每步需重新理解规则,导致表现不佳。

尚未确认

  • 无。

为什么重要

  • 该发现挑战了当前业界通用的隔离式模型评测方法,开发者@Angaisb指出,通过优化测试框架就能轻易解决复杂任务,这意味着此类基准测试并不能真实代表模型的实际能力。
  • 产品框架(如ChatGPT和Codex的内部机制)与模型能力的深度协同,对模型在复杂任务上的表现有决定性影响。
  • 单纯比较模型在裸跑基准测试中的分数,可能无法准确衡量不同AI系统的真实智能水平。