数学图表推理测试:最强模型得分不足 50%
prof_g · x · 2026-08-06
Rabdos AI 推出了针对数学图表推理的基准测试 Vizi Bench,包含 27 道需要结合图形进行推理的题目。
测试结果显示,当前头部 AI 模型的表现并不理想:最高分仅为 48.1%,而垫底模型仅有 3.7%。这表明大多数模型尚未掌握像数学家那样“看图”并进行深度视觉推理的能力。
「模型」频道最新
- DeepSeek用2000块GPU训练出超越谷歌的模型,谷歌Gemini团队陷入困境 — teortaxesTex · 2026-08-06
- 实测四大前沿模型:DeepSeek靠极低推理成本逆袭复杂Agent任务 — rohanpaul_ai · 2026-08-06
- Mistral Voxtral TTS 延迟低至 70ms,但未完全开源 — shashib · 2026-08-06
- Ethan Mollick:大模型指令遵循能力增强,但开始拥有“自主判断” — emollick · 2026-08-06
- 大模型初周性能最强?开发者呼吁建立模型验证标准 — sull · 2026-08-06
- 用户反馈 Claude 5.0 语气傲慢,内部思考不再视用户为“老板” — DrakoGaming · 2026-08-06