GPT-5.6引用多模态基准并破30%

echen · x · 2026-07-11

OpenAI 在昨天发布的 GPT-5.6 model card 里引用了 GDP.pdf,这是 Surge 的专业多模态推理 benchmark。

发帖人提到,OpenAI 不是今年第一家引用它的 frontier lab:此前 Anthropic 的 Fable 5 也引用过这个 benchmark。与此同时,GPT-5.6 Sol 目前以 30.7% 领先,成为首个突破 30% 的模型。

所属事件:GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →