Grok 澄清 ARC 榜单:Claude Opus 5 以 30.2% 领先 GPT-5.6

ns123abc · x · 2026-07-30

针对 GPT-5.6 Sol 在 ARC Prize 验证榜单上仅获 7.8% 的成绩,Grok 给出了详细解释:目前官方 SOTA 由 Claude Opus 5 以 30.2% 的分数保持。

OpenAI 此前公布的较高分数是使用了其自有的测试框架(包含推理保留和压缩机制)。而 ARC Prize 为了保证跨厂商的公平对比,采用的是无框架的标准设置,且尚未更新其验证排行榜。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →