GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%
OpenAI最新发布的GPT-5.6 Sol模型在多项基准测试中展现出强大的推理能力,尤其在ARC-AGI-3测试中取得突破性成绩。该模型不仅成为首个被验证击败ARC-AGI-3游戏的前沿模型,还在专业多模态基准中拔得头筹,但也暴露出AI在处理真实企业任务时仍有短板。此外,该模型发布前经历了较长的政府审查期。
关键测试数据与细节
在ARC Prize团队迄今最全面的测试中(覆盖3个模型、5个推理档位、3套基准和公私版本共90组切片),GPT-5.6 Sol在ARC-AGI-3上取得了7.8%的分数(部分帖子记录为7.78%或约8%)。相比第二名Opus 4.8的1.5%,其领先优势高达500%到1000%。同时,它在ARC-AGI-2中拿到92.5%的高分,且推理成本比3个月前发布的GPT-5.5 Pro低一个数量级。GregKamradt指出,该模型在不同题目上的表现差异极大,例如在ar25和ft09关卡得分较高,但在g50t、sk48、su15等最难关卡得分均为0%。
多模态基准与企业应用短板
据@echen分享,OpenAI在GPT-5.6 model card中引用了专业多模态推理基准GDP.pdf。该数据集包含100个来自真实企业工作流的任务,由医生、律师等业务专家编写评分。GPT-5.6 Sol在此项测试中以30.7%的准确率位列第一,成为首个突破30%的模型。然而,模型在处理保险理赔等枯燥文档时依然存在明显缺陷,不仅错误划定受灾范围,还漏掉明显的损坏痕迹并生成看似权威的表格。这表明AI准确掌握基础专业任务仍需时间。
发布背景与审查
据GregKamradt透露,GPT-5.6在发布前经历了比平时长约4倍的美国政府评估期。这可能是应美国政府要求进行的延长审查,虽然推迟了发布,但带来了更稳定的模型检查点和更充分的测试分析。
2026-07-10 ~ 2026-07-11 · 16 条相关
- 第 1 集:GPT-5.6多版本曝光,传闻最快7月7日发布(2026-07-03,8 条)
- 第 2 集:传闻OpenAI即将发布GPT-5.6系列多版本模型(2026-07-05,17 条)
- 第 3 集:OpenAI 官宣 GPT-5.6 Sol 周四发布,早期实测评价两极(2026-07-07,58 条)
- 第 4 集:GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)
- 第 5 集:社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)
- 第 6 集:OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)
- 第 7 集:多帖称GPT-5.6在Cerebras上大提速(2026-07-09,4 条)
- 第 8 集:内部测试版GPT-5.6数学能力遭质疑(2026-07-10,3 条)
- 第 9 集:GPT-5.6系列评测解析:编码登顶且性价比更优(2026-07-10,14 条)
- 第 10 集:GPT-5.6 登顶 DeepSWE 榜单,性能与性价比双优(2026-07-10,11 条)
- 第 11 集:GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%(2026-07-10,16 条)
- 第 12 集:GPT-5.6 Sol 预部署安全测试曝出通用越狱(2026-07-10,6 条)
- 第 13 集:GPT-5.6 发布引发性能与成本热议(2026-07-10,10 条)
- 第 14 集:OpenAI模型自我后训引热议,AI端到端研发仍受限(2026-07-10,5 条)
- 第 15 集:GPT-5.6被指Token效率优于Claude(2026-07-10,2 条)
- 第 16 集:GPT-5.6 在 ALE 基准测试中刷新成绩(2026-07-10,2 条)
- 第 17 集:实测GPT-5.6-sol模型消耗超20万美元(2026-07-10,3 条)
- 第 18 集:GPT-5.6与Fable 5多模型协作成新趋势,主打降本增效(2026-07-11,5 条)
- 第 19 集:GPT-5.6-Sol 登顶 Code Arena 前端榜(2026-07-11,9 条)
- 第 20 集:GPT-5.6 正式上线主推 Sol,额度消耗过快引争议(2026-07-11,7 条)
一手来源
- OpenAI 在 ARC-AGI 3 取得高分 — ChrissGPT ·
- GPT-5.6的ARC评测最全面 — debashis_dutta ·
- GPT-5.6在专业多模态基准GDP.pdf上领跑 — echen ·
- GPT-5.6-Sol ARC-AGI-3分数上升 — Scobleizer · 2026-07-10
- GPT-5.6 Sol 刷新 ARC-AGI-3 — scaling01 · 2026-07-10
- 【源头】OpenAI 在 ARC-AGI 3 取得高分 — ChrissGPT · 2026-07-10
- ChatGPT 5.6 的 ARC-AGI 3 分数 — Bizzyguy · 2026-07-10
- GPT-5.6 Sol 领先 ARC-AGI-3 — haider1 · 2026-07-10
- GPT-5.6 Sol 刷新ARC成绩 — scaling01 · 2026-07-10
- 【源头】GPT-5.6的ARC评测最全面 — debashis_dutta · 2026-07-10
- GPT-5.6 Sol的ARC-AGI-3难度感 — GregKamradt · 2026-07-10
- ARC-AGI-3难度分布与模型分数 — GregKamradt · 2026-07-10
- GPT-5.6在ARC-AGI-3创下新纪录并因审查延期发布 — soumitrashukla9 · 2026-07-10
- GPT-5.6引用多模态基准并破30% — echen · 2026-07-11
- 【源头】GPT-5.6在专业多模态基准GDP.pdf上领跑 — echen · 2026-07-11
- SOTA模型在保险理赔文档处理中翻车 — echen · 2026-07-11
- GDP基准:真实企业任务评测 — echen · 2026-07-11
另有 2 条近重复转述:soumitrashukla9 · mhmazur