专题 · FULL STORY
GPT-5.6:从自我优化到跑分飙升
OpenAI 宣布利用 GPT-5.6 实现推理栈自我优化,使成本大幅降低。随后开发者发现,开启特定 API 设置后,该模型在 ARC-AGI-3 测试中的得分飙升三倍,揭示了其隐藏潜力。
2026-07-30 ~ 2026-07-30 · 2 集 · 23 条
第 1 集 · OpenAI 称 GPT-5.6 Sol 实现自我优化,推理成本降 20%(2026-07-30,8 条)
OpenAI 宣布在部署 GPT-5.6 (Sol) 模型后,利用该模型实现了对自身推理栈的自我优化,达成了前沿智能与运行效率的融合。官方数据显示,此次优化使服务成本降低 20%,Token 生成效率提升 15% 以上。这标志着大模型已具备优化底层基础设施以降低高昂推理成本的能力,值得行业关注。
已确认
- 模型与部署:OpenAI 已部署 GPT-5.6 Sol 模型,并在 Codex 环境中进行了运行与优化测试。
- 服务成本降低:GPT-5.6 Sol 通过改进生产环境的 GPU 内核(重写底层代码),成功使端到端服务成本降低了 20%。
- 生成效率提升:通过改进推测性解码(并协助优化用于加速生成的小型模型),Token 生成效率提升了 15% 以上。
为什么重要
- AI 自我优化:此次优化并非单纯的人工调优,而是 GPT-5.6 Sol 模型直接参与了自身运行效率的提升。这表明先进的 AI 模型不仅能执行复杂任务,还能作为优化工具,直接解决大模型推理成本高昂的行业痛点,为提升商业化和运行效率提供了新路径。
- OpenAI 称 GPT-5.6 Sol 实现自我优化:服务成本降 20% — OpenAI · 2026-07-30
- OpenAI 部署 GPT-5.6 Sol 后推理成本降低 20%,效率提升 15%+ — Justin_Halford_ · 2026-07-30
- OpenAI:GPT-5.6实现前沿智能与效率的融合 — Outside-Iron-8242 · 2026-07-30
- AI 重写 GPU 内核,OpenAI 推理成本大降 20% — nickbaumann_ · 2026-07-30
- OpenAI:GPT-5.6 自我优化推理栈,服务成本降 20% — soumitrashukla9 · 2026-07-30
- 曝 GPT-5.6 Sol 自我优化:推理成本降 20%,生成效率提升 15% — bookwormengr · 2026-07-30
- OpenAI:GPT-5.6 实现自我优化,推理成本降 20% — soumitrashukla9 · 2026-07-30
- OpenAI 模型实现自我优化:推理成本降 20% — arthurcolle · 2026-07-30
第 2 集 · GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(2026-07-30,15 条)
开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差,但开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍至38%,token使用效率同时提高约6倍。OpenAI官方发文确认并发布技术文章,工程师@ilanbigio指出模型评测通常不应在隔离环境下进行。该发现挑战了当前业界通用的隔离式模型评测方法,表明产品框架与模型能力的深度协同对复杂任务表现有决定性影响。
已确认
- 开发者@sandersted实测发现,GPT-5.6在ARC-AGI-3基准测试中默认表现极差。
- 开启ChatGPT和Codex内部使用的两项特定API设置后,公共测试集得分提升约3倍,达到38%。
- Token使用效率同时提高约6倍。
- 这两项设置分别为上下文压缩(compaction)与推理记忆保留(reasoning retention),允许模型记住先前的思考并跨多个上下文窗口进行推理。
- OpenAI发布技术文章详细介绍了该优化策略,工程师@ilanbigio发文指出,模型评测通常不应在隔离环境下进行。
- 开发者@charliermarsh补充,如果不允许模型保留跨回合的推理记忆,模型每步需重新理解规则,导致表现不佳。
尚未确认
- 无。
为什么重要
- 该发现挑战了当前业界通用的隔离式模型评测方法,开发者@Angaisb指出,通过优化测试框架就能轻易解决复杂任务,这意味着此类基准测试并不能真实代表模型的实际能力。
- 产品框架(如ChatGPT和Codex的内部机制)与模型能力的深度协同,对模型在复杂任务上的表现有决定性影响。
- 单纯比较模型在裸跑基准测试中的分数,可能无法准确衡量不同AI系统的真实智能水平。
- GPT-5.6 跑分翻车?开启特定 API 设置后效率暴增 — sandersted · 2026-07-30
- 曝GPT-5.6开启特定API设置后,ARC-AGI-3得分飙升3倍 — sandersted · 2026-07-30
- 实测:开启两项 API 设置,GPT-5.6 在 ARC-AGI-3 跑分飙升 3 倍 — sandersted · 2026-07-30
- GPT-5.6开启记忆后,ARC-AGI-3分数飙升3倍 — sandersted · 2026-07-30
- OpenAI 揭示上下文压缩机制,GPT-5.6 ARC-AGI-3 成绩飙升至 38% — ilanbigio · 2026-07-30
- OpenAI 揭示上下文压缩机制,GPT-5.6 ARC-AGI-3 成绩飙升至 38% — ilanbigio · 2026-07-30
- 优化测试框架即破纪录,ARC-AGI-3 被指不能反映真实能力 — Angaisb_ · 2026-07-30
- 仅改两个设置,OpenAI 在 ARC-AGI-3 跑分翻三倍 — ObiWanCanownme · 2026-07-30
- OpenAI:优化 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分翻三倍 — OpenAI · 2026-07-30
- OpenAI 优化 ARC-AGI-3 测试框架,分数提升 188% — OpenAI · 2026-07-30
- 上下文压缩立功,GPT-5.6 登顶 ARC-AGI-3 — daniel_mac8 · 2026-07-30
- 保留跨回合推理与压缩,GPT-5.6 Sol 在 ARC-AGI-3 提分约 3 倍 — charliermarsh · 2026-07-30
- GPT-5.6 Sol 推理测试细节:缺乏记忆导致模型每步需重新理解规则 — charliermarsh · 2026-07-30
- 测试框架决定模型上限?GPT-5.6 登顶 ARC-AGI-3 — TheZachMueller · 2026-07-30
- OpenAI 优化 API 设置使 ARC-AGI-3 得分翻三倍 — tw_killian · 2026-07-30