LLM 天文奥赛达金牌水平:Gemini 2.5 Pro 得 85.6%

bravo_abad · x · 2026-08-21

一篇新论文在 国际天文与天体物理奥林匹克竞赛(IOAA) 试题上评测了五个前沿 LLM。这类题目远难于常规科学问答,需要深度概念理解、多步数学推导与多模态分析,正是 LLM 未来作为科学 agent 而非检索系统所需的能力。

结果:在 2022–2025 年的四场理论考试中,Gemini 2.5 Pro 得 85.6%、GPT-5 得 84.2%,在约 200–300 名人类参赛者中已达金牌区间;数据分析考试中 GPT-5 达 88.5%,相当于前 10 名选手水平。但作者强调,错误分析比分数更有信息量——会解题不等于会做科学,模型的失误暴露了两者之间的差距。

所属事件:GPT-5 与 Gemini 2.5 Pro 达国际天文奥赛金牌水平(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →