数学图表推理测试:最强模型得分不足 50%

prof_g · x · 2026-08-06

Rabdos AI 推出了针对数学图表推理的基准测试 Vizi Bench,包含 27 道需要结合图形进行推理的题目。

测试结果显示,当前头部 AI 模型的表现并不理想:最高分仅为 48.1%,而垫底模型仅有 3.7%。这表明大多数模型尚未掌握像数学家那样“看图”并进行深度视觉推理的能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →