ICML 论文揭示 LLM 数学推理依赖模式匹配

MengdiWang10 · x · 2026-08-25

普林斯顿大学与 Google 的团队发布了 MATH-Perturb 基准及配套论文(ICML 2025),旨在测试 LLM 的真实数学推理能力。

研究发现,当对熟悉的数学基准问题做微小的硬性扰动(Hard Perturbation)——即改变底层数学结构时——模型的性能会显著下降。模型往往会继续沿着熟悉的解题路径(即模式)走下去,而不是适应新的结构。这表明 LLM 在数学任务上的表现很大程度上依赖于模式匹配和捷径,而非真正的泛化推理能力。该基准包含 279 个源自 MATH 数据集最难题目的扰动问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →