SciArena 7月15日退役,o3 登顶科学问答榜

7 月 15 日,Allen AI 面向「科学文献问答」场景的模型评测平台 SciArena 正式退役。这个由研究者亲自为模型答案打分的评测不仅留下最终榜单,更沉淀下一批真实科学问题与专家标注的真值数据,被视为后续更可靠科学问答评测的底座。项目累计吸引约 1,700 名用户参与。

关键结果

Allen AI 更新称,o3 在 SciArena 排行榜上位居第一,领先于 Claude Opus 4.1、Gemini 3 Pro Preview 以及 DeepSeek-R1 等开源权重模型。

研究者最看重什么

SciArena 结果显示,研究者评判答案时最看重的三项指标依次为引用质量(23%)、深度(19%)和是否直接回答问题(16%)。Allen AI 据此强调,在科学文献问答场景里,参考文献是否真实、相关、可核查比流畅文笔更重要——文笔好并不能单独取胜。

数据资产与后续

Allen AI 表示,SciArena 的主要价值在于收集到真实科学问题、专家偏好与经过验证的反馈,并形成高质量、专家标注的 ground truth。团队认为,随着越来越多 AI agent 被用于评估其他 AI agent,评测本身必须建立在可靠数据之上。相关分析将在 NeurIPS 2025 Spotlight 论文中进一步展开,讨论科学家如何评价 AI 生成的答案。

2026-07-16 ~ 2026-07-16 · 6 条相关

一手来源