GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%

OpenAI最新发布的GPT-5.6 Sol模型在多项基准测试中展现出强大的推理能力,尤其在ARC-AGI-3测试中取得突破性成绩。该模型不仅成为首个被验证击败ARC-AGI-3游戏的前沿模型,还在专业多模态基准中拔得头筹,但也暴露出AI在处理真实企业任务时仍有短板。此外,该模型发布前经历了较长的政府审查期。

关键测试数据与细节

在ARC Prize团队迄今最全面的测试中(覆盖3个模型、5个推理档位、3套基准和公私版本共90组切片),GPT-5.6 Sol在ARC-AGI-3上取得了7.8%的分数(部分帖子记录为7.78%或约8%)。相比第二名Opus 4.8的1.5%,其领先优势高达500%到1000%。同时,它在ARC-AGI-2中拿到92.5%的高分,且推理成本比3个月前发布的GPT-5.5 Pro低一个数量级。GregKamradt指出,该模型在不同题目上的表现差异极大,例如在ar25和ft09关卡得分较高,但在g50t、sk48、su15等最难关卡得分均为0%。

多模态基准与企业应用短板

据@echen分享,OpenAI在GPT-5.6 model card中引用了专业多模态推理基准GDP.pdf。该数据集包含100个来自真实企业工作流的任务,由医生、律师等业务专家编写评分。GPT-5.6 Sol在此项测试中以30.7%的准确率位列第一,成为首个突破30%的模型。然而,模型在处理保险理赔等枯燥文档时依然存在明显缺陷,不仅错误划定受灾范围,还漏掉明显的损坏痕迹并生成看似权威的表格。这表明AI准确掌握基础专业任务仍需时间。

发布背景与审查

据GregKamradt透露,GPT-5.6在发布前经历了比平时长约4倍的美国政府评估期。这可能是应美国政府要求进行的延长审查,虽然推迟了发布,但带来了更稳定的模型检查点和更充分的测试分析。

2026-07-10 ~ 2026-07-11 · 16 条相关

事件全程(共 20 集)→

一手来源

另有 2 条近重复转述:soumitrashukla9 · mhmazur