50 位物理学家出题,GPT-5 完整课题准确率仅 5.7%

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

cs.AI, cond-mat.other, cs.CL, hep-th, quant-ph

2025-10-01

CritPt 召集 50 多位在职物理学家写出 71 道未公开研究题。最好基座 GPT-5 (high) 完整课题准确率仅 5.7%,加上代码工具也只到 10.6%。

这篇在解决什么

现有 LLM 评测大多停在奥数、编程和研究生课业。物理研究真正要的能力不一样:题目没有公开题解、答案没法靠检索撞上、中间一步错后面整条链作废。Argonne 与伊利诺伊大学香槟分校领衔、50 多位在职物理研究者用自己手头的课题,做成了 CritPt(Complex Research using Integrated Thinking - Physics Test,读作 critical point)。它问的是更硬的问题:模型能不能在未见过的入门级研究任务上站住。

难度被专家对齐成「导师给低年级博士生的热身课题」:方法是公开的,但要把已知工具拼成一条新的、可验证的解。

方法

CritPt 有两层。71 道完整挑战模拟一个小型研究项目;每道再拆成 2 到 4 个检查点,一共 190 道,用来看模型卡在整题还是卡在局部。覆盖凝聚态、量子信息、原子分子光物理、高能、数学物理、天体、统计、核物理、非线性、流体和生物物理,近一半题目跨两个以上方向。理论、实验、计算三类口味都有。

题目全部新写、未公开。答案做成抗猜测、可机器核验的形式:带精度的浮点数组、复杂符号表达式,或带测试用例的 Python 函数。评测分两步:先让模型自由写推导,再强制抽成规范代码块。自动打分按专家给定的物理容差、SymPy 等价和测试用例比对。70 道测试题答案不公开,只开在线打分服务器,必须整批提交、每账号每天限 10 次,防刷题泄漏。

一道完整挑战平均超过 40 小时专家工时,经过多轮修订和同行审。

结果

主指标是五次独立运行的平均准确率。完整挑战上,无工具的最强基座是 GPT-5 (high),只有 5.7%。加上代码解释器升到 10.6%,再加网页搜索只到 12.6%。搜索几乎帮不上忙,说明题目抗检索。其余推理模型都在 2% 及以下,聊天模型 GPT-4o、Llama-4 Maverick 和 GPT-5 (minimal) 是 0。

模型完整挑战检查点(自带上文)
GPT-5 (high, code & web)12.6%21.4%
GPT-5 (high, code)10.6%20.0%
GPT-5 (high)5.7%15.3%
Gemini 2.5 Pro2.0%8.1%
o3 (high)1.4%7.4%

检查点更接近「今天能帮忙的局部任务」。GPT-5 (high) 自带上文 15.3%,把上一检查点的专家答案喂进去到 20.0%。更严的指标「五次里至少四次对」上,只有 GPT-5 家族能稳定解开任何完整挑战:无工具 4.3%,加代码 8.6%,加搜索 10.0%。其余模型这项全是 0。

为什么重要

这是一份按物理研究真实工作流、而不是按教科书题库做的评测。对做科研助手的人,结论很冷:完整课题现在靠不住;拆成定义清楚的局部步骤、再配代码工具,才开始有一点用。网页搜索几乎不抬分,说明这条板凳测的是推理,不是检索。对物理圈,检查点上的偶发正确解还要花大量时间核对,有时比自己算还慢。

局限与存疑

可靠性指标只跑了五次,作者自己说这不是统计充分的置信度声明。70 道测试题答案封存,社区只能看在线打分,没法独立复现每一步。检查点即使喂了专家中间答案,最好模型也刚过 20%。评测主要看终答,推理痕迹的物理正确性只在示例题上做了专家精读。GPT-5 刚在收数据末期发布,相对 o3 的进步很小,但后续模型会不会很快刷分,还要看封存答案守不守得住。

术语

原文与代码

社区讨论

相关论文

全部论文解读