OpenAI 声称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但依赖自定义测试环境

The Decoder · rss · 2026-07-30

OpenAI 声称其模型 GPT-5.6 Sol 在 ARC-AGI-3 基准上达到 38.3% 的分数,超过了 Anthropic 的 Opus 5(30.2%)。但该成绩是在 OpenAI 自己的 API 环境下使用保留推理和上下文压缩获得的;在官方测试环境中,该模型仅得 7.8%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →