CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4%

bookwormengr · x · 2026-09-15

物理推理基准 CritPt 原始成绩显示顶级模型仅约 9–13% 起步,并随新模型发布在 30–32% 附近趋平。但一项新审计发现 56 道题中有 21 道存在基准错误。修复或剔除这些题目后,GPT-5.6 Sol 在修正版基准上 pass@4 达到 94.4%。虽然设置与官方榜单不可直接比较,但强烈表明物理-数学推理差距被高估了,前沿模型的物理推理能力可能远比原先认为的强。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →