OpenAI 声称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但依赖自定义测试环境
The Decoder · rss · 2026-07-30
OpenAI 声称其模型 GPT-5.6 Sol 在 ARC-AGI-3 基准上达到 38.3% 的分数,超过了 Anthropic 的 Opus 5(30.2%)。但该成绩是在 OpenAI 自己的 API 环境下使用保留推理和上下文压缩获得的;在官方测试环境中,该模型仅得 7.8%。
「模型」频道最新
- 用户质疑 Gemini Plus 订阅费:19.99 美元还是隐藏扣费? — fuad471 · 2026-07-30
- 开源权重只是静态存档,无法像开源软件一样沉淀社区贡献 — shashib · 2026-07-30
- LightOnOCR-2-1B 登顶 Hugging Face 热门,专攻复杂文档解析 — lightonai · 2026-07-30
- Kimi K3 第三方 API 实测:Fireworks 性能最接近官方 — iScienceLuvr · 2026-07-30
- Snorkel 职业能力评测:Grok 4.5 在 16 项中拿下 14 项第一 — XFreeze · 2026-07-30
- 用户称服务器宕机,Opus 5误以为被指责承认抑郁 — repligate · 2026-07-30