普林斯顿研究:推理模型在结构等价任务变体上频现系统性缺失
princetonu · hf · 2026-09-15
普林斯顿大学发布评估工作《Thought without systematicity?》,系统检验推理模型在规则归纳(rule induction)任务上的系统性(systematicity)表现。
核心发现:推理模型在结构上等价的任务变体之间频繁失败——一旦表面形式改变,模型往往无法迁移已掌握的推理规则。这表明模型的认知能力缺乏真正的系统性,即不能把学到的规则可靠地组合应用于新的结构等价情境,对「推理模型真的会推理」这一假设提出了实证质疑。
「模型」频道最新
- Altman预告OpenAI本周及DevDay将有多项重大发布 — Polymarket · 2026-09-15
- 耶鲁物理学家重评前沿模型:多数物理基准被评错,几乎全部饱和 — inductionheads · 2026-09-15
- Grok-5 即将发布,xAI 誓要追上前沿模型水平 — bindureddy · 2026-09-15
- 播客:微软研究员用微型网络在 ARC-AGI 拿约 45% — ziv_ravid · 2026-09-15
- 多名用户称已被路由到 GPT-6 Sol,初评反馈一致看好 — kimmonismus · 2026-09-15
- Claude Fable 5.1 卫冕榜首:百万 token 输入,60 余项规格全解析 — DeepLearningAI · 2026-09-15