苹果新基准揭露大模型数学能力假象:仅靠模式匹配
anirbanbandyo · x · 2026-08-17
苹果研究人员发布新基准 GSM-Symbolic,测试大模型的数学推理能力。与静态题库不同,该基准通过动态改变题目中的名字、数字和变量来生成新题。结果显示,当数值改变时,模型准确率急剧下降。研究表明,大模型在数学基准上的高分并非源于真正的逻辑推理,而是依赖训练数据中的模式匹配,本质上是在猜测而非解题。
「模型」频道最新
- DeepSeek V4 Pro 全测试:最强开源模型? — WorldofAI · 2026-08-17
- 观察发现 AI 喜欢在同意你时夺回主导权 — Steve_Yegge · 2026-08-17
- Qwen3.8-27B GGUF 量化版登顶 Hugging Face 趋势榜 — AtomicChat · 2026-08-17
- 用户实测豆包: coding 能力远不及 Codex 与 Claude — Sad-hurt-and-depress · 2026-08-17
- GPT-5.6 luna 降价后性价比极高,延迟大降 — haider1 · 2026-08-17
- 8款前沿大模型横评:10维度50细项,两轮测试出双榜 — lxfater · 2026-08-17