苹果新基准揭露大模型数学能力假象:仅靠模式匹配

anirbanbandyo · x · 2026-08-17

苹果研究人员发布新基准 GSM-Symbolic,测试大模型的数学推理能力。与静态题库不同,该基准通过动态改变题目中的名字、数字和变量来生成新题。结果显示,当数值改变时,模型准确率急剧下降。研究表明,大模型在数学基准上的高分并非源于真正的逻辑推理,而是依赖训练数据中的模式匹配,本质上是在猜测而非解题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →