OlympiadBench:8476 道双语多模态奥赛题,GPT-4V 仅得 17.97%
geoffwolfe · x · 2026-09-22
OlympiadBench:奥赛级双语多模态科学基准
- 该基准收录 8476 道奥赛级数学与物理题目(含中国高考题),全部为双语多模态,并附专家级逐步推理标注。
- 考察的是模型读图、跨语言推理与持续科学推导能力,而非猜测答案。
- 评测中表现最好的 GPT-4V 平均仅得 17.97%,物理只有 10.74%;错误分析显示幻觉、知识缺失与逻辑谬误普遍存在。
- 数据与评测代码开源于 GitHub(OpenBMB/OlympiadBench)。
- 转发方 ReasonCoreAI 表示其库存已纳入 OlympiadBench 风格任务,用于训练与评估这类耦合能力(带自我营销成分)。
「研究」频道最新
- 曝 OpenAI 训练仅 24 天的模型已解决百余道数学长期难题 — soumitrashukla9 · 2026-09-22
- Yann LeCun 与 Moderna 联合创始人加盟 Cellular Intelligence,押注 AI 预测细胞行为 — arjunrajlab · 2026-09-22
- OpenMined 用 PySyft 三角色分工破解外部 AI 评估扩容难题 — iamtrask · 2026-09-22
- RL 细节讨论:奖励重分配算法与在线过滤 reward hack — stochasticchasm · 2026-09-22
- RL 训练新思路:用 agent 在沙盒里做组内对比取代 pairwise — stochasticchasm · 2026-09-22
- Frank Nielsen 论文:变分 Jensen-Shannon 散度推广与信息半径对称化 — FrnkNlsn · 2026-09-22