Rabdos 发布数学 AI 基准,Claude Opus 5 暂列榜首
AI4Code · x · 2026-08-07
Rabdos 推出了一项名为 Rabdos Math Index 的综合数学 AI 评测基准,旨在全面衡量模型在证明、计算和视觉感知方面的数学推理能力。
该基准包含形式化的研究生级定理、研究级数值问题以及需要图表视觉推理的题目。在首期榜单中,Claude Opus 5 以 46 分领先,GPT-5.6 Sol 与 Claude Fable 5 并列 39 分,其余受测模型均未超过 25 分。
所属事件:Rabdos发布数学AI评测基准,Claude Opus 5暂居榜首(2 条相关)→
「模型」频道最新
- ChatGPT免费版开放无限制对话,GPT-5.6 Sol 专精优化聊天体验 — 量子位 · 2026-08-07
- 实测多模型API成本:Grok比Kimi便宜13倍 — rohanpaul_ai · 2026-08-07
- Muse Spark 1.2登顶性价比前沿,算力成本仅Claude五分之一 — ArtificialAnlys · 2026-08-07
- Meta Muse Spark 1.2登顶性价比前沿,成本仅为Claude六分之一 — ArtificialAnlys · 2026-08-07
- OpenAI新硬件主打情感陪伴?用户吐槽其模型缺乏个性 — Angaisb_ · 2026-08-07
- 曝字节跳动正讨论训练 5 万亿参数大模型 — ZeroStateReflex · 2026-08-07