GPT-5.6在专业多模态基准GDP.pdf上领跑

echen · x · 2026-07-11

OpenAI 和 Anthropic 近期相继引用了名为 GDP.pdf 的专业多模态推理基准测试。该基准主要针对合同、临床记录等枯燥的专业文档。

在最新测试中,GPT-5.6 Sol 以 30.7% 的准确率位列第一,成为首个突破 30% 大关的模型。

所属事件:GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →