Rabdos发布数学AI评测基准,Claude Opus 5暂居榜首

Rabdos AI 推出了名为 Rabdos Math Index 的综合数学推理评测基准,旨在全面衡量大模型在形式化证明、计算求解和视觉感知等方面的数学能力,测试题包含研究生级别内容。在最新公布的榜单中,Anthropic 的 Claude Opus 5 暂列榜首,展现了其在复杂数学推理任务上的领先优势。

2026-08-06 ~ 2026-08-07 · 2 条相关