LLM 天文奥赛达金牌水平:Gemini 2.5 Pro 得 85.6%
bravo_abad · x · 2026-08-21
一篇新论文在 国际天文与天体物理奥林匹克竞赛(IOAA) 试题上评测了五个前沿 LLM。这类题目远难于常规科学问答,需要深度概念理解、多步数学推导与多模态分析,正是 LLM 未来作为科学 agent 而非检索系统所需的能力。
结果:在 2022–2025 年的四场理论考试中,Gemini 2.5 Pro 得 85.6%、GPT-5 得 84.2%,在约 200–300 名人类参赛者中已达金牌区间;数据分析考试中 GPT-5 达 88.5%,相当于前 10 名选手水平。但作者强调,错误分析比分数更有信息量——会解题不等于会做科学,模型的失误暴露了两者之间的差距。
所属事件:GPT-5 与 Gemini 2.5 Pro 达国际天文奥赛金牌水平(2 条相关)→
「模型」频道最新
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24
- 用户指控 Qwen 模型编造其未发表过的言论 — Thin_Pollution8843 · 2026-08-24
- 观察发现 Codex 积分耗尽后仍继续运行任务 — gandamu_ml · 2026-08-24
- 开发者长文梳理:Claude 系列存在「动机性推理」倾向 — tszzl · 2026-08-24