Rabdos 发布数学推理评测,Claude Opus 5 领先
prof_g · x · 2026-08-06
Rabdos AI 推出了 Rabdos Math Index,这是一个旨在全面衡量大模型在证明、求解和感知方面数学推理能力的综合评测基准。
在该榜单中,Anthropic 的 Claude Opus 5 以 47 分位居第一,OpenAI 的 GPT-5.6 Sol 以 41 分紧随其后,而其他所有受测模型的得分均未超过 25 分。
「模型」频道最新
- 预测市场看好Anthropic:2026年AI霸主概率达69% — Polymarket · 2026-08-06
- DeepSeek 试错加 Opus 兜底:开发者分享 AI 编程模型组合技 — gandamu_ml · 2026-08-06
- Palantir 实测:NVIDIA 原版模型 24 小时即超越前沿大模型 — eliano · 2026-08-06
- 传谷歌 Gemini 3.5 Pro 已部署完毕,最快今日发布 — Rare_Bunch4348 · 2026-08-06
- 开发者痛批谷歌AI掉队:自2017年Transformer后无突破 — MarcJSchmidt · 2026-08-06
- 实测 Qwen3.8-Max 多模态能力:精准提取图像边界框 — lateinteraction · 2026-08-06