2026-08-21
俄亥俄州立团队用 IOAA 2022–2025 共 57 题测五个模型。Gemini 2.5 Pro 理论均分 85.6%、GPT-5 84.2%,达金牌并多年排进前二;数据分析只有 GPT-5 稳住 88.5%,几何与空间推理全员弱 15–26 分。
天文圈已经有过用大模型做引力波搜寻、多波段星系解读这类任务演示。那些例子只能证明某条流水线能跑通,测不到模型在概念推导、近似判断、读图和天球几何上到底行不行。现成基准更窄:AstroBench、Astro-QA 这类多选题,测的是天文知识回忆,不是研究里真正要的多步推导。
俄亥俄州立大学和圣保罗大学的团队把国际天文与天体物理奥林匹克(IOAA)2022–2025 四年的理论卷和分析卷拿来当基准。IOAA 每年大约 200–300 名中学生选手,大纲覆盖宇宙学、球面三角、恒星物理、天体力学、测光和仪器。观察卷要望远镜和星图,模型做不了,被整卷拿掉。
题库是 49 道理论题加 8 道数据分析题,共 57 题。题目以 LaTeX 原文加图喂给模型,附带选手现场也会拿到的常数表:16 个物理常数、26 个天文参数、6 条微积分公式。Prompt 要求逐步推导、公式用 LaTeX、作图用 tikzpicture/pgfplots,推理残缺不得分。每题只跑一遍,不许重试。
评分按官方细则,两位 IOAA 考官独立打分。Lucas Carrit Delgado Pinheiro 是 2018 年选手、2022/2023/2025 领队、2024 学术委员;Bruno Caixeta Piazza 履历类似。285 份答卷(57×5)全部对完分,分歧讨论到一致。宽松只针对介质差:LaTeX 画图编译失败但文字描述对了,按人手绘给分;语法噪音不伤数学内容的不扣。错一步带崩后面的数字,只扣出错那一步,不连环罚。
五个模型是 GPT-5、Gemini 2.5 Pro、OpenAI o3、Claude Opus 4.1、Claude Sonnet 4。知识截止日期最晚到 2025 年 3 月,当年 8 月的比赛天然无污染。2022–2024 有泄漏风险,但 2025 分数和四年均分接近,作者据此判断污染影响有限。
理论题按推理类型拆成两类:约 37% 是 Category I,天球几何、球面三角、坐标变换;63% 是 Category II,不靠空间想象的天体物理计算。难度按选手中位数划:Easy(中位高于 50%)占 21%,Medium 25%,Hard 35%,Extra Hard 19%。奖牌按相对中位数:铜 100–130%,银 130–160%,金超过 160%。观察卷没测,金牌线是理论卷和分析卷各自单独算的,不是三卷总分。
理论卷四年均分,Gemini 2.5 Pro 85.6%(±8.0),GPT-5 84.2%(±6.1),后面一截掉下去:o3 77.5%,Opus 64.7%,Sonnet 60.6%。分年看,GPT-5 在 2022(93.0%)、2023(89.6%)、2025(86.8%)最高;2024 几何题占比冲到总分的 63%,Gemini 以 83.0% 反超,GPT-5 掉到 67.5%。
和人比,百分比看起来没那么夸张。2025 理论金牌线只有 31.3%,五个模型全过金。GPT-5 的 86.8% 排第 1,是中位数的 443%。2022、2023、2025 三年,GPT-5 超过了当年理论卷第一名选手;Gemini 在 2022 和 2023 同样做到。唯一掉到银牌的是 Claude Sonnet 4 的 2023 理论卷(57.4%,排第 62)。
数据分析卷把差距拉开。GPT-5 均分 88.5%,比它自己的理论卷还高,四年全金、都能进前十,2022 和 2023 还超过最佳选手。其余模型从理论到分析掉 10–15 个百分点:Gemini 75.7%,o3 67.7%,Opus 54.8%,Sonnet 47.9%。2024 和 2025 的分析卷,两个 Claude 掉到铜牌或没牌。Sonnet 2025 只有 30.0%,中位数的 84.4%,排第 177。
按题型拆开,短板集中在几何。Category II 物理计算,前三名都在 89–91%;Category I 几何空间,Gemini 78.6%,GPT-5 76.1%,两个 Claude 掉到约 52%,落差 15–26 个百分点。理论卷失分里,概念错误加几何/空间错误合计占 60–70%。计算、记法、近似这几类扣得很少。
失败案例不抽象。2024 理论第 10 题日食几何,只有 GPT-5 和 Gemini 处理了日、月、地一般不共线;另外三个模型直接当成共线,整条路作废。2025 第 1 题一个 120° 的探测器夹角,正确答案 30°,除 Gemini 外全算成 60°。2025 第 2 题选回归年还是恒星年,五个模型第一问全错。读图也不稳:模型能背出维恩位移定律,却挑不对选项里那张黑体曲线。
对做天文工具和科研 agent 的人,这篇把「模型会不会天文」从知识问答换成了可对照人类的奥赛标准。结论可以拆着用。公式核对、参数扫描、概念交叉检查,头部模型已经够当副手。要它独立读观测图、做球面几何、自己判断近似是否成立,现在还不行。
和 IMO、IPhO、IOI 那几篇奥赛评测是同一条线,补上了天文这一科。AstroBench 上这几个模型分得并不开,换到 IOAA 推导题,Opus 和 GPT-5 差出将近 20 分。知识问答榜看不出的能力裂缝,在这里被放大了。
这是一篇评分很认真的评测,不是新方法。价值在对照:官方细则、两位真奥赛考官、再用 2025 年新题做污染检查。局限与存疑
观察卷没测。完整 IOAA 金牌是三卷合计相对中位数。这里的「金牌」是分卷相对中位数,不是当场和人比总成绩。排名是每个模型单独插入选手名单,不是五模型和人混排。每题只跑一次,看不到采样方差。数据分析题一共 8 道,对多模态能力的判断样本偏薄。2022 年几何类分数偏虚:13 道理论题里只有 4 道 Category I,其中一道长题改编自 1981 年蝌蚪/马蹄轨道论文,有污染。两位阅卷人也是作者,交叉校验在内部完成。
IOAA 再难也是有标准答案的闭卷考试。能拿分卷金牌,离自主科研 agent 还隔着观测、仪器和开放问题。