Rabdos 发布数学 AI 基准,Claude Opus 5 暂列榜首

AI4Code · x · 2026-08-07

Rabdos 推出了一项名为 Rabdos Math Index 的综合数学 AI 评测基准,旨在全面衡量模型在证明、计算和视觉感知方面的数学推理能力。

该基准包含形式化的研究生级定理、研究级数值问题以及需要图表视觉推理的题目。在首期榜单中,Claude Opus 5 以 46 分领先,GPT-5.6 Sol 与 Claude Fable 5 并列 39 分,其余受测模型均未超过 25 分。

所属事件:Rabdos发布数学AI评测基准,Claude Opus 5暂居榜首(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →