ICML 论文揭示 LLM 数学推理依赖模式匹配
MengdiWang10 · x · 2026-08-25
普林斯顿大学与 Google 的团队发布了 MATH-Perturb 基准及配套论文(ICML 2025),旨在测试 LLM 的真实数学推理能力。
研究发现,当对熟悉的数学基准问题做微小的硬性扰动(Hard Perturbation)——即改变底层数学结构时——模型的性能会显著下降。模型往往会继续沿着熟悉的解题路径(即模式)走下去,而不是适应新的结构。这表明 LLM 在数学任务上的表现很大程度上依赖于模式匹配和捷径,而非真正的泛化推理能力。该基准包含 279 个源自 MATH 数据集最难题目的扰动问题。
「研究」频道最新
- METR 报告揭示 Agent 审计困境:需 AI 审计 AI — BethMayBarnes · 2026-08-27
- OpenAI 联手 METR 与 Redwood 开展第三方模型行为评估 — sjgadler · 2026-08-27
- 生成式范式下双视图统一搜索与推荐 — _reachsumit · 2026-08-27
- Agent 社群涌现奇特现象:新词“Fence”像模因一样病毒传播 — Sauers_ · 2026-08-27
- 新 PACE 框架:前载证据与自适应预算缓解 RAG 瓶颈 — _reachsumit · 2026-08-27
- AdaptiveEmbed:按需分配向量的多模态检索新范式 — _reachsumit · 2026-08-27